AnthropicがClaude Codeに自社アプリの日次保守を任せています。
Anthropicが、自社で開発しているアプリの日常的な保守作業をClaude Codeに任せる実験を進めていることが明らかになりました。数週間で388本のプルリクエスト(コードの変更提案)が自動生成され、そのうち180本、割合にして約46パーセントが人間のレビューを経て採用されたと報告されています。AIが提案し、人間が承認する。この分業がどこまで実務に耐えるのかを、開発元自身が自社のコードベースで測っている点に、この発表の意味があります。士業事務所にとっては直接の業務変更を伴うニュースではありませんが、AI生成物の採用率という数字が公表された事例として読む価値があります。
12種類の保守ルーチンが毎日自動で回っている
今回の実験では、Claude Codeが12種類前後の定型保守ルーチンを毎日実行しています。The Decoderが伝えたところによれば、Claude Codeの開発者であるBoris Chernyが自身のLinkedIn投稿でこの取り組みを紹介しました。
動いている場所は、社内の専用Slackチャンネルです。iOS、Android、デスクトップ、Web、コマンドライン、Agent SDKという複数のプラットフォームを横断して、Claudeが日次のルーチンを回しています。
ルーチンの内訳が具体的です。シミュレータでアプリを起動してランダムに操作し、クラッシュを発生させて原因を解析し修正まで作る「Crash Fuzzer」。コードベースの中から似ているけれど微妙に違う実装を探し出して統合を提案する「Dup Unifier」。到達不能なコードを削除する「Dead-Code Remover」は、疑わしいコードに対してはいったんログ出力を仕込み、翌日に実際に使われていないかを確認してから消すという慎重な手順を踏みます。ほかにも、失敗しようのないテストの削除、不安定なCIテストの修正、過剰に複雑な抽象化の単純化といったルーチンが並びます。
指示の出し方は特別なものではないとChernyは述べています。凝ったプロンプト設計をするのではなく、日常の言葉で「iOS、Android、デスクトップでクラッシュ検出の日次ルーチンを始めて、モックを使わず実機のアプリで、クラッシュを起こして、修正付きのプルリクエストを作って」と伝えるだけだといいます。

採用率46パーセントという数字の読み方
この実験でもっとも注目されるのは、388本のうち180本という採用の実績です。Chernyはこの結果を「驚くほど良好」と評価しつつ、あくまで「これが可能かもしれないという初期の兆候」だと位置づけています。
半分以上のプルリクエストが採用されなかったという事実は、二通りの読み方ができます。ひとつは、AIが自律的に生成した変更のうち過半数はまだ人間の基準を満たさない、という限界の側面です。もうひとつは、レビューという関門を残したうえでなお、人手をかけずに180本分の保守が前に進んだという成果の側面です。どちらか一方だけを取り出すと実態を見誤ります。
運用の実態にも触れられています。Claudeはたいてい一度目で正しいプルリクエストを出すものの、うまくいかない場合はチームがルーチン側の指示を調整し、翌日にはより良い結果が出るように直していく。この調整に数日かかることもあるといいます。つまり、AIに任せきりで完成するのではなく、指示を育てる作業が人間側に残っているということです。Anthropicは現在、こうした機械的な変更についてマージまでの手続きを速める方法を検討している段階だと報じられています。
士業事務所から見た読みどころと、今後の動き
このニュースは、士業事務所の明日の手続きを変えるものではありません。ソフトウェア開発の現場の話であり、制度変更でも職能団体の通知でもないからです。ただし、業務の性質という点では重なる部分があります。
士業の業務にも、判断を要する部分と、定型的な確認・整理の部分があります。書式の点検、前年データとの突合、記載漏れの洗い出しといった作業は、後者に近い性質を持ちます。今回の実験が示したのは、そうした定型作業をAIに投げたときに、レビューを通過する割合がどの程度になるのかという実測値です。46パーセントという数字を、自事務所の定型業務に置き換えて考えてみる材料になります。全部が通るわけではない、しかし何もしなければゼロだった、という前提で運用設計を組み立てている事務所もあります。
データの取り扱いについては、この発表から読み取れることが限られます。今回公表されたのはAnthropicが自社の環境で自社のコードを対象に行った実験であり、外部の利用者のデータがどう扱われるかについては何も述べられていません。事務所で生成AIツールの導入を検討する際は、この発表とは別に、各ベンダーの利用規約やプライバシーポリシーを確認する段階です。守秘義務を負う情報を扱う以上、入力したデータが学習に使われるかどうか、保存期間はどうなっているかという点は、契約プランごとに確認しておきたい論点になります。
今後の焦点は、この採用率が時間とともにどこまで上がるかです。ルーチンの調整が積み重なれば数字は動きます。開発元が自社で継続的に測っている以上、続報が出る可能性は高いとみられます。また、こうした「AIが提案し人間が承認する」運用が開発以外の領域にどこまで広がるかも、注目される点です。
まとめ
AnthropicがClaude Codeに自社アプリの日次保守を任せた実験で、388本のプルリクエストのうち180本、約46パーセントが人間のレビューを経て採用されました。開発者本人は初期段階の兆候だと慎重に位置づけています。士業事務所にとっては直接の制度変更ではありませんが、定型業務をAIに任せたときの採用率という具体的な数字が公開された事例として、自事務所の運用設計を考える材料になります。
参考文献
- The Decoder「Claude Code now runs daily maintenance on Anthropic’s software with a 46 percent merge rate」
- Boris Cherny LinkedIn投稿
- Anthropic Claude Code 公式ページ
- Anthropic プライバシーポリシー
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: The Decoder
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。