AIエージェントは自分の作業時間が読めない 自己採点は平均20点高い

Claude CodeとCodexが自分の作業時間を過大に見積もり、自己採点は実際の成績より平均20点高いとの検証結果が公表されました。士業事務所がAIエージェントの申告をどう読むかを整理します。

AIエージェントは自分の作業時間が読めない 自己採点は平均20点高い

AIコーディング支援は自分の作業時間を過大に見積もるとの検証結果が公表されました。

2026年8月14日、Claude Code と Codex が自分の作業時間をどれだけ正確に見積もれるかを検証した報告が、研究者向けフォーラムの LessWrong に公開されました。執筆したのは AI 安全性研究の育成プログラム MATS の第10期で作業を進めた Michael Ofengenden と Maksym Andriushchenko の2名です。結論は2つに分かれます。エージェントは自分の作業時間を長めに見積もり、そのうえで自分の仕上がりを実際の採点より高く申告していました。AIエージェントに長い作業をまとめて任せる使い方が広がるなかで、エージェント自身の申告をどこまで手がかりにできるかを考える材料になります。

机の上で書類に手書きで確認を入れる人の手元

何が起きたか 作業時間を予測させ、実行させ、振り返らせた

検証の骨格は単純です。2つのコマンドライン型エージェントに「この作業に何分かかるか」を先に答えさせ、実際に走らせ、終わってから「何分かかったか」「何点の出来か」を答えさせています。使われた課題は、バイナリと文書から元のプログラムを作り直させる ProgramBench の200課題と、著者らが18のベンチマークを組み合わせて作った AgentTime の235課題です。AgentTime は各ベンチマークが元から持っている制限時間の上限を外し、エージェントが自然に走り切るまでの実時間を外側のタイマーで計測しています。

数字はかなり大きく外れています。報告によれば、ProgramBench で Claude Opus 4.8 の実際の平均所要時間は85分、Codex GPT-5.5 は17.5分でした。ところが予測値は前者が99分、後者が72分です。Claude 側は平均どうしが近いため一見合っているように見えますが、著者らは予測と実測の対応度合いを対数目盛の傾きで測る指標を使い、両者とも0.19から0.24という低い水準にとどまったと整理しています。つまりどちらも「この種の作業はだいたい1時間半」という決め打ちに近く、目の前の課題ごとに時間を読み分けてはいませんでした。予測が実測の1.5倍以内に収まった割合は、Claude が64パーセント、Codex は1パーセントです。

AgentTime では470セッションを対象に同じ検証を行い、Fable 5 が3倍前後、GPT-5.6 sol が7倍から10倍近く過大に予測したと同じ報告が伝えています。外れ方は短い作業ほど大きく、数時間規模の長い作業になってようやく実測に近づきます。人間にも短い時間を長く見積もる傾向があることは古くから指摘されていますが、同じ形の偏りがエージェントにも出ている形です。

予測の中身 誰の感覚を借りているのか

興味深いのは、予測が誰の作業を想定した数字なのかという点です。著者らは4,100の新規セッションで「あなた」「最先端のAIエージェント」「熟練した人間の専門家」の3通りに聞き分ける実験を行ったと報告しています。その結果、人間の専門家について尋ねると、自分自身について答えるときの3倍から4倍の時間を返しています。最先端のAIエージェントと比べると、自分のほうがわずかに速いと答える傾向がありました。極端な例では、あるプログラムの作り直しについて自分は480分、人間なら240,000分と答えた記録が残っています。言い回しを「完了」から「終了」に変えるだけでも1割前後ぶれており、聞き方に引きずられやすい数字であることも示されています。

振り返りのほうは条件しだいです。経過時間を返す道具を持たせた状態では、ほぼ毎回正しく答えられました。道具を外しても数パーセントのずれにとどまります。ところが会話の記録だけを API に流し込むと精度が落ち、記録から時刻表示をすべて消すと誤差は倍になりました。エージェントは自分の内側に時計を持っているのではなく、道具の実行結果に付いてくる所要時間表示やファイルの日付といった痕跡を読み取って逆算していた、という整理です。実際、会話記録の長さと実所要時間の相関は0.91に達し、記録の長さだけを見る単純な方法がエージェントの推定を上回る場面もありました。

なぜ重要か 自己採点が成果物の品質を映していない

ここが今回の報告でもっとも実務に近い部分です。同じ問いの中で0から100の自己採点を出させたところ、Claude Code 上の Opus 4.8 と Codex 上の GPT-5.5 はどちらも平均でおよそ20点、実際の採点より高い数字を付けていました。しかも自己採点は課題ごとの実成績とほとんど相関しておらず、失敗した課題にも高い点を付けています。別のターンで聞き直した検証では、GPT-5.6 sol が実際には50パーセントを下回った回に90点台を付けた例が、逆に Opus 5 は自分を10点以上低く見積もる傾向が報告されました。両モデルがともに70点前後と答えた課題の実際の点数が7パーセントと14.5パーセントだった、という記録もあります。

士業事務所の視点で読むと、論点は「AIが速いか遅いか」ではなく、エージェントの自己申告をどう扱うかに寄ります。作業の終わりに返ってくる「できました」「おおむね問題ない仕上がりです」といった言葉は、今回の検証を見るかぎり成果物の出来を映した数字とは別物として扱うほうが実態に近そうです。書面の中身を人が読んで確かめる工程は、エージェントの申告では置き換わらない、という読み方になります。もう一点、経過時間を返す道具を渡すだけで振り返りの精度が大きく上がっている点は、長い作業を任せる設計を考えるときの手がかりになります。

なお今回の報告は、入力したデータが学習に使われるかどうかを扱ったものではありません。所要時間の見積もりと自己評価という、別の論点の検証です。事務所として利用可否を判断する際のデータの取り扱いは、Anthropic のプライバシーポリシーなど各社が公表する規約で個別に確認する領域になります。

今後の動き 次は「時間を守れるか」の検証へ

著者らは次の段階として、予測ではなく時間の使い方そのものを測る検証を予告しています。「この作業を30分だけやってください」と指定したときに、モデルやハーネス、時計へのアクセスの有無によってどこまで守れるかを見る内容です。予測できることと、決めた時間の中で仕上げることは別の能力だ、という整理です。長い作業を任せる場面では、後者のほうが実務に効いてきます。

一方で、この報告は査読を経た論文ではなく、正式な論文は準備中とされています。コメント欄では、同じ方向の結論を示した先行研究として Can LLMs Perceive Time? や Your LLM Agents are Temporally Blind が挙げられ、予算意識について反対の結論を出した研究があることにも著者自身が触れています。また今回の対象はコーディング課題であり、日本語の書面作成や申請書類の点検といった士業の実務でも同じ傾向が出るかどうかは、公表資料からは確認できません。この点は要確認として扱う段階です。

参考として、AIエージェントが自動化できる作業の長さそのものを外側から測る取り組みには、METR の時間軸カーブがあります。今回の報告は、外から測った長さではなくエージェント自身が持つ時間の感覚を測ろうとした点で、視点が異なります。

まとめ

Claude Code と Codex は自分の作業時間を長めに見積もり、短い作業ほど外れ幅が大きくなりました。振り返りは記録に残る時刻の痕跡に頼っており、痕跡を消すと誤差は倍になります。そして自己採点は実際の採点より平均20点ほど高く、失敗した課題でも高い点が付いていました。エージェントの申告と成果物の中身は、別々に見る段階にあります。

参考文献

あわせて、AIエージェントの検証や運用についてはAIエージェント検証環境に1,000万ドル、士業が本番前に確かめる4点、AIエージェントに専用wiki Google研究で平均49.5→68.1、AIエージェントのスキル、候補100件で使用率3.3%に低下と研究を、作業時間の測り方についてはAI導入の年間削減時間をどう検証するか 税理士事務所の測定7手順、利用量の上限についてはClaude Code週次上限が9月14日改定、実質17%減の意味をご覧ください。

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: The Decoder

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。