AIエージェントのスキル、候補100件で使用率3.3%に低下と研究

AIエージェントのスキルは候補が5件から100件に増えると実使用の精度が29.6%から3.3%へ低下するとプリンストン大などの研究が報告。効く理由は手順の安定化で、壊れるのは検索側だと分かりました。

AIエージェントのスキル、候補100件で使用率3.3%に低下と研究

AIのスキル機能は候補が増えるほど使われなくなると研究が示しました。

プリンストン大学などの研究チームは2026年8月、AIエージェントに手順書を持たせる「スキル」の効き方を分解した論文をプリプリントとして公開しました。スキルは効果がある一方で、候補となるスキルの数が5件から100件に増えると、実際に正しいスキルが使われた割合が29.6パーセントから3.3パーセントまで落ちるという結果が報告されています。AIエージェントに事務所独自の手順を覚えさせる取り組みが広がるなかで、その運用設計に直接関わる内容です。

スキル検索の評価設計図。正解スキルと紛らわしい候補を混ぜた候補プールを用意し、埋め込みによる順位付け、エージェントによる明示的選択、実行環境での全件実行という三つの手順で別々に評価する流れ

何が公開されたか、8,135件の試行を分解した研究

公開されたのは、Demystifying Agent Skills: Why They Work—Until They Don’tと題されたプリプリント論文です。プリンストン大学、カリフォルニア大学サンディエゴ校、スタンフォード大学、南カリフォルニア大学、ジョンズ・ホプキンス大学の研究者が共同で執筆しています。

ここでいうスキルとは、AIエージェントが作業中に呼び出せる手順書のことです。何をするか、何を確認するか、どんな落とし穴を避けるかを短くまとめたテキストで、Anthropicが提唱した形式では「SKILL.md」というファイルとして扱われます。これまでの評価は「スキルを入れると成功率が上がるかどうか」という総量の比較が中心でした。今回の研究は、そこから一歩踏み込んで「いつ効くのか、なぜ効くのか、どこで壊れるのか」を切り分けています。

研究チームは複数のベンチマークとモデル、複数のエージェント基盤を組み合わせた統制実験を行い、8,135件の試行記録を正規化しました。さらに240件の実行記録を人手で分類し、238件の有効なラベルを得たうえで、3つの上位カテゴリと12のスキル利用モードからなる分類体系を組み立てています。

なぜ重要か、効く理由と壊れ方が別々だと分かった

この研究の要点は、スキルが効く理由と壊れる場所がまったく別のところにあると示した点です。

まず効く理由について。研究では、スキルが働いた事例の65.7パーセントが「手続きのアンカリング」に分類されました。つまりスキルは、モデルが知らない知識を外から注ぎ込んでいるのではなく、実行の手順を安定させることで効いているという整理です。知識を明示的に注入したと分類された事例は4.5パーセントにとどまりました。過去の実行ログをそのまま保存する「ワークフローメモリ」と条件をそろえて比べた場合、スキルは6.06ポイント上回ったと報告されています。

一方で壊れる場所は、スキルの中身ではなく検索の側にありました。候補となるスキルのプールを5件から100件まで増やしていくと、実際に使われたスキルが正解だった割合は29.6パーセントから3.3パーセントへ落ちます。ライブラリが育つほど、エージェントは手元にあるはずのスキルを見つけられなくなるということです。

もう一つ目を引くのが、紛らわしい候補を混ぜたときの挙動です。似たスキルを並べるとオフラインでの識別精度は下がりますが、最終的な作業の成功率は安定していました。研究チームはここから、正解のスキルをそのまま呼び出すことは成功の十分条件でも必要条件でもないと述べています。スキルが失敗するのは、前提が脆いとき、文脈が噛み合わないとき、状況に合わせた調整が足りないときだと整理されています。

士業事務所のAI運用にとっての読みどころ

この研究が示す構図は、事務所でAIエージェントに独自の手順を持たせようとしている場面と重なります。申告書のチェック手順、就業規則の確認観点、登記書類の作成フローといった業務知識をファイルにまとめてAIに持たせる運用は、すでに現場で試され始めています。

そこで示唆になるのが、数を増やすほど良くなるわけではないという点です。手順書を100本用意しても、必要な場面で呼び出されなければ効果は出ません。まず数本に絞って運用し、名前と説明文が互いに紛らわしくないかを確認しながら増やしていく進め方を採る事務所があります。作った手順書が実際に呼び出されたかどうかをログで確認する段階だと言えます。

もう一点、手順書に何を書くかという論点があります。スキルのファイルはAIに読み込ませる前提のテキストですから、そこに顧客名や個別案件の情報を書き込めば、そのまま外部サービスへ送られることになります。手順書には業務の型だけを書き、個別情報は入れないという線引きが必要です。利用するサービスが入力データを学習に使うかどうかは、ベンダーの公表資料で確認する必要があります。今回の論文は研究であって特定サービスの仕様を示すものではないため、データの取り扱いは各事務所が利用中のサービスの規約で個別に確認する事項です。

今後の動き

論文はプリプリントであり、査読を経た版ではありません。数値の解釈は今後変わる可能性があります。ただ、スキルの評価軸を「総合的な成功率」から「検索できているか」「適用場面が合っているか」へずらすという方向性は、今後のエージェント設計に影響しそうです。手順書を書く技術と、それを見つけさせる技術は別物だという整理が広がるかどうかが注目点です。

まとめ

AIエージェントのスキルは、知識を注ぎ込むのではなく手順を安定させることで効いており、その効果は候補が増えると検索の段階で失われます。候補が5件から100件に増えると実使用の精度は29.6パーセントから3.3パーセントに低下しました。事務所で手順書を整備する際は、数を増やす前に呼び出されているかを確かめる段階です。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: arXiv

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。