AIエージェントに専用wiki Google研究で平均49.5→68.1

Google ResearchがAIエージェントの経験をwikiへ蓄積するWikiSkillを公開。Gemini-3.5-Flashは平均49.5から68.1へ。士業事務所が読むべき論点を整理します。

AIエージェントに専用wiki Google研究で平均49.5→68.1

Google Researchが、AIエージェントの知識蓄積手法を公開しました。

Google Researchの研究チームが2026年8月27日、AIエージェントが自分の経験を「wiki」として溜め込み、そこから手順書(スキル)を育てていく枠組み「WikiSkill」の論文をarXivで公開しました。5種類のベンチマークと5種類のモデルで検証したところ、Gemini-3.5-Flashの平均スコアはスキル無しの49.5から68.1へ伸びています。AIエージェントの「経験の溜め方」を正面から扱った研究で、事務所がAIエージェントを使うときに何が資産として残るのかを考える材料になります。士業のチカラでは、公表された研究内容の事実関係を整理したうえで、士業事務所の視点から気になった点を挙げます。

ノートパソコンの画面を指さしながら二人で作業する様子

WikiSkillはAIエージェントの経験をどう蓄積するのか

WikiSkillは、AIエージェントの作業場を3つの層に分けます。実行の記録をそのまま残す「Raw Layer」、そこから整理された知識を保つ「Wiki Layer」、実際に手順として使われる「Skill Layer」の3層です。論文の要旨では、生の実行経験・蓄積された知識・実行可能なスキルを分離したうえで、経験を継続的にwikiへ統合していくと説明されています。

動作は4つの部品の組み合わせです。現在のスキルを使って作業を実行する「Inference Agent」、実行記録をwikiへまとめ直す「Wiki Maintainer」、wikiと記録をもとにスキルの更新案を出す「Skill Proposer」、そして検証データで成績が上がった更新だけを採用する「Gating and Rollback」です。ここで効いてくるのが、スキルの更新は取り消される場合があっても、wikiに書かれた知識は残るという設計です。うまくいかなかった試行も知識としては残り、次の更新の土台になります。

この発想の出発点として、論文はAndrej KarpathyのLLM Wikiという見方、すなわち経験を持続的で積み上がる知識へとコンパイルするという考え方を挙げています。従来の手法(Trace2Skill、EvoSkill、SkillOpt)は、学んだことをスキルそのものや最適化の履歴の中に散らばらせていて、独立した知識の層を持っていませんでした。そこを分けたのがWikiSkillの主張です。

なお、ここでいう「スキル」は、指示やスクリプトをディレクトリにまとめた再利用可能なモジュールを指します。Anthropicが公開しているAgent Skillsの解説でも同じ形式が説明されており、モデルのパラメータを更新せずに専門知識を持たせる方法として広がっています。この形式の効きどころと限界については、エージェントのスキルが効く場面と失敗する場面を扱った研究でも触れました。

なぜ数字が重要なのか 小さいモデルが大きいモデルを上回る

検証は5種類のベンチマークで行われました。数学推論のLiveMathematicianBench、ウェブ検索のSealQA、表計算操作のSpreadsheetBench、長文書類の質問応答のOfficeQA、対話型タスクのALFWorldです。モデルはGemini-3.5-Flash、Qwen-3.5-4B、Qwen-3.5-9B、Qwen-3.6-27B、Gemma-4-31Bの5種類で、論文の本文によれば、報告されたスコアはいずれも評価プロセス全体を3回独立に走らせた平均値です。

数字を並べると傾向が見えます(出典はいずれも論文の結果表)。Gemini-3.5-Flashの5ベンチマーク平均は、スキル無しで49.5、WikiSkillで68.1でした。Qwen系では改善幅がモデルの大きさとともに広がり、4Bで12.3ポイント、9Bで17.5ポイント、27Bで23.9ポイントの改善です。表計算に限れば、Qwen-3.6-27Bは40.8から81.7へ伸びています。

特に目を引くのは2点です。ひとつは、スキルを持った小さいモデルが、スキルを持たない大きいモデルを上回った点です。Qwen-3.5-9BにWikiSkillのスキルを与えると平均47.4となり、スキル無しのQwen-3.6-27Bの39.4を超えました。もうひとつは、スキルがモデルをまたいで持ち運べた点です。ALFWorldでは、Qwen-3.5-9BがQwen-3.6-27Bの育てたスキルを使うと70.2に達し、自分で育てたスキルの63.4を上回りました。論文はここから、スキルを発見する能力とスキルを実行する能力は別物ではないか、と述べています。

士業事務所の目で読むと、気になる点がいくつか出てきます。ひとつは、スキルがファイルとして読める形で残るため、後から中身を確認できるという性質です。AIが何を根拠にその手順を採ったのかを辿れるかどうかは、事務所がプラグインやスキルを審査するときの判断材料になります。もうひとつは、蓄積される「経験」の中身です。日々の作業記録が知識として溜まっていく仕組みは、そこに顧問先の情報がどう含まれるかを把握しないままだと、見えない部分が増えることを意味します。生成AIと守秘義務の関係を整理するときに、蓄積層をどう扱うかという論点が加わる形です。

なお本件は研究フレームワークの論文であり、特定のサービスで入力データが学習に使われるかどうかを述べたものではありません。実務でツールを選ぶ際のデータの取り扱いは、各ベンダーの利用規約とプライバシーポリシーで確認する話であり、本研究とは別の論点です。

今後の動き 実装と再現性が次の焦点

論文はCC BY 4.0で公開されており、査読前のプレプリントの段階です。実装コードの公開状況、Googleの製品への搭載予定、日本語での業務タスクに同じ傾向が出るかどうかは、執筆時点の公表資料からは確認できませんので要確認とします。

見どころは3つあると考えます。第一に、スキルがモデル間で移植できたという結果が他のチームでも再現されるかどうかです。再現されれば、育てたスキルはモデルを乗り換えても残る資産という見方が強まります。第二に、蓄積されたwikiが大きくなったときに、どこまで有効さを保てるかです。知識が増えるほど取り出す難しさも増すため、エージェントの検証環境を整える動きと合わせて見る必要があります。第三に、こうした自動でスキルを育てる仕組みが、法務向けのエージェント製品のような業務ツールへどう降りてくるかです。

まとめ

Google Researchが公開したWikiSkillは、AIエージェントの経験を持続的な知識として溜め、そこからスキルを育てる枠組みです。Gemini-3.5-Flashの平均は49.5から68.1へ伸び、スキル付きの小さいモデルがスキル無しの大きいモデルを上回りました。事務所の視点では、手順が読める形で残ることと、蓄積される経験に何が含まれるかの2点が観察のしどころになります。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: arXiv

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。