数学者2人が2026年8月、LLMの強みは知識と試行量だと指摘しました。
2026年8月、著名な数学者2人が相次いでLLM(大規模言語モデル)の得意・不得意を論じました。フィールズ賞受賞者のティモシー・ガワーズは自身のブログで、LLMが数学の難問を解けるのは「広い知識」と「大量に試せる速度」による面が大きいと整理しています。数論のピーター・サーナクは米国数学会の会報で、AIが数学のどこで壁に当たるかを試すための思考実験を提案しました。士業のチカラでは、この2つの論考を士業事務所のAI活用を考える材料として整理します。なお本記事は法的な評価を示すものではなく、公表された論考の内容を紹介するものです。
LLMが解いたもの、そして詰まっているもの
ガワーズの論旨は、LLMの成果は「新しい発想」ではなく「広い知識と試行量」で説明できる部分が大きい、というものです。2026年8月12日に公開されたWhat sort of maths are LLMs good at?で、ガワーズは執筆の数日前にOpenAIが数学と理論計算機科学の重要問題10件を解いたと発表したことに触れ、その中には非ソフィック群の初の構成や、多色ラムゼー数が超指数的に増大することの証明が含まれていたと書いています。自身が「生きているうちに解決を見るとは思っていなかった」と評するほどの成果です。
そのうえでガワーズは、LLMが疑いなく持っている強みを2つに絞っています。ひとつは膨大な数学知識で、比較的標準的な議論で解ける問題ならまず見つけてくること。もうひとつは計算機であること自体に由来する速度で、人間には割に合わない数の失敗を重ねてから正解にたどり着けることです。この2つが合わさると、人間とは違う「多くのアイデアを試して当たりを引く」スタイルになると整理しています。
逆に人間側に残っている可能性がある領域として挙げられているのが、探索木を刈り込む勘です。ガワーズはこれを「nose(嗅覚)」と呼び、現時点のモデルにはまだ十分に備わっていないという印象を述べています。ChatGPTの上位モデルと未解決問題を議論すると、有望そうに聞こえるが精査すると見劣りする方針を提示されることが多く、「答えは出せていないが、より狭く精密な問題に還元できた」という返答が進展のないまま5回続くこともある、という具体的な描写もあります。専門家の反応についても、ガワーズのブログは「当初は問題が解けたことに驚いたが、よく見ると手法はそれほど目新しくなく、適切な小さなヒントがあれば相応の専門家でも十分見つけられたものだと分かった」という趣旨の感想がしばしば聞かれると書いています。
「AlphaZeroテスト」という別角度の問い
サーナクの論考は、AIが数学のどこで止まるかを判定する具体的な試験を提案するものです。米国数学会の会報Noticesの2026年8月号に掲載されたPeter Sarnak on “The AlphaZero Test” for Mathematicsで、プリンストン大学教授のサーナクは、半プロのチェスプレイヤーだった経歴を踏まえてチェスAIと数学を比較しています。
サーナクの整理では、Stockfishはチェス理論に基づいて作られており、強いプレイヤーならその指し手を理解できます。一方のAlphaZeroは理論もデータベースも使わず、自己対局と統計的機械学習だけで最善手を推定し、人間に理解できる説明を返しません。ここからサーナクは「AlphaZeroテスト」を提案します。外部のデータも理論も一切参照できない定理証明機に、ラマヌジャン予想をラマヌジャン自身が定式化した初等的で明示的な形で入力し、真偽を判定させるという試験です。
サーナクはこの試験に機械は失敗するだろうと述べ、抽象化と概念化、そして数学理論という体系の積み上げを使って証明されている定理の多くについても同様だろうと予想しています。数学の世界は無限であること、ゲーデルとコーエンが示したように形式体系の中では真偽を決められない命題があることを、チェスとの決定的な違いとして挙げています。仮にこの予想が外れた場合の含意も書かれており、「関心のある命題が真であると(証明済みとして)分かっていながら、なぜ真なのかは理解していない」状態に置かれるため、数学とは何かを考え直す必要が出てくるとしています。
その一方で、サーナクは定理証明機の価値を否定していません。既存の理論体系にアクセスできる前提であれば、現在の理論の射程内にある問題、つまり多くの数学者が日常的に取り組んでいる種類の問題については機械が力を発揮し、競技チェスにおけるStockfishのような重要な道具になるだろうという見立てです。今の到達点については、チェスでいえば1950年代あたりではないかという表現が使われています。

なぜこの2つの論考が重要なのか
2人の論点は出発点が違いますが、指している方向は近いところがあります。ガワーズは「広い知識と大量試行で届く範囲」と「探索を刈り込む勘が要る範囲」を分け、サーナクは「既存理論の射程内」と「新しい抽象を立てる必要がある範囲」を分けています。どちらも、AIの現在地をベンチマークの点数ではなく、問題の性質で切り分けようとしている点が共通しています。ベンチマークそのものの限界という論点は、AIベンチマークを自社データで作るOptima、事務所のモデル選定3視点でも触れました。
もうひとつ重要なのは、2人とも自分の予想が外れる可能性を明示している点です。ガワーズは「LLMには決してXができない」という主張はしないと断ったうえで、2016年のキャップ集合問題の解決に匹敵する驚きのある証明が出てくれば、壁は越えられたと判断できると書いています。サーナクも予想が外れた場合の帰結まで書いています。断定ではなく、判定条件をあらかじめ置いているわけです。AIの能力評価が過熱しやすい局面で、この書き方自体が参考になります。
なお、ガワーズは7月26日にもLeiden Declaration(AIと数学に関する数学者たちの宣言)についての考察を公開しています。数学の側からAIをどう位置づけるかの議論が、この数か月で続いていることが分かります。
士業事務所の視点で読むと
このテーマは数学の話ですが、AIをどこまで任せるかを考える材料として読める部分があります。ここでは3つの視点を挙げます。
第一に、業務の性質による切り分けです。ガワーズが挙げたLLMの強みは、広い知識と大量の試行でした。条文・通達・様式・過去の類似案件を素早く広く探すことと、その案件の筋をどう立てるかを判断することは、必要な能力が異なるという見方ができます。事務所内でAIに任せる範囲を考える際、業務を「量で押せるもの」と「筋を読むもの」に分けて眺める整理は使えそうです。どの業務をAIに委ねているかの実態については、5人に1人がAIに委任、1106人調査が示す士業事務所の外注設計3論点でも取り上げています。
第二に、説明可能性です。サーナクが挙げた「正しいと分かるが、なぜ正しいかは理解できない」という状態は、依頼者や関係機関への説明を仕事の一部としている士業にとっては重い論点になり得ます。出力が正しいかどうかと、その理由を自分の言葉で説明できるかどうかは別の問題です。専門性そのものが摩耗していく懸念については、AI導入が専門性を枯らす 査読論文が示す士業の認知コモンズ5要因で扱っています。
第三に、検証の工程です。ガワーズが描いた「有望そうに聞こえるが精査すると弱い方針」は、実務でも起こり得る形の失敗です。誰がどの段階で検証するのかを事務所として決めているかどうかが、AI活用の実効性を左右する部分だと考えられます。あわせて、AIに何を入力するかの範囲についても、守秘義務との関係で事前に整理しておく論点があります。
まとめ
ガワーズはLLMの成果を「広い知識と大量試行」で説明し、探索を刈り込む勘が人間側に残る可能性を指摘しました。サーナクは外部知識を断った「AlphaZeroテスト」を提案し、抽象化と理論体系を要する定理では機械が失敗するだろうと予想しています。2人とも判定条件を明示しており、AIの現在地を能力の総量ではなく問題の性質で見る枠組みを示した論考として読めます。
参考文献
- Gowers’s Weblog “What sort of maths are LLMs good at?”(2026年8月12日)
- Notices of the American Mathematical Society “Peter Sarnak on ‘The AlphaZero Test’ for Mathematics”(2026年8月号 pp.587-589)
- Gowers’s Weblog “Thoughts about the Leiden Declaration”(2026年7月26日)
- Leiden Declaration on Artificial Intelligence and Mathematics
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: Gowers’s Weblog
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。