AI単独が医師+AIに勝る、2030年予測のJAMA論考と士業の検証前提

JAMAに自律型AI単独が医師とAIの併用を上回るとする論考が掲載。ChatGPT o3が60%対16%という数字や2030年予測を整理し、士業事務所の検証工程への示唆をまとめます。

AI単独が医師+AIに勝る、2030年予測のJAMA論考と士業の検証前提

JAMAに、自律型AI単独が医師とAIの併用を上回るとする論考が掲載されました。

医学誌JAMAに2026年8月、自律型AI単独の医療が、医師とAIが組んだハイブリッド体制を上回りうるとする論考が掲載されました。人間が最終確認に入るほど品質が上がる、という広く共有されてきた前提に、正面から異を唱える内容です。士業のチカラは有資格の専門家による確認を経ずに編集していますので、本記事は公表された論考の内容と報道の事実関係を整理したものであり、医療上の判断や法的評価を示すものではありません。それでもこの論考を取り上げるのは、AIの出力に人間のチェックを重ねる運用が本当に品質を上げているのか、という問いが士業事務所のAI運用設計と地続きだからです。

何が起きたか、JAMAに載った「AI単独優位」の論考

論考は、AIは臨床判断の補助にとどめるべきだという米国内科学会の立場に対し、明確に異なる見方を示しています。Forbesが2026年8月17日に報じたところによると、執筆者は生命倫理学者のEzekiel Emanuel、研究フェローのAbe Baker-Butler、そしてCurai HealthのCEOであるNeal Khoslaの3名で、JAMAに掲載されました。

論考が根拠として挙げているデータは具体的です。同じForbesの報道によれば、Googleの医療対話モデルAMIEは、患者の訴えを聞き取る、症状を確認する、病歴を取るという場面で人間の医師より有意に良い成績を示したとされています。また、ChatGPT o3が実世界の複雑な377症例のうち60パーセントで最終診断を最初に言い当てたのに対し、内科医20名は302症例のサブセットで約16パーセントにとどまったという研究も引かれています。

さらに踏み込んでいるのが、人間を介在させると結果が悪化しうるという指摘です。Forbesの報道では、2024年の研究として、AI主導のケーススタディに実際の医師を加えたところ、AI単独の場合より成績が明確に悪化したという結果が紹介されています。加えて論考は、AIに認知的な作業を委ね続けるほど医師自身の臨床能力が落ちていくという、AI起因のスキル低下にも言及しているとされています。

なぜ重要か、ハイブリッドが最善という前提が揺れている

重要なのは、この論考が個別のモデル性能ではなく、人間とAIの組み合わせ方そのものを論点にしている点です。AIの精度が上がったという話であれば、確認する人間の負担が減るという結論に落ち着きます。しかしこの論考は、確認する人間を入れること自体が結果を下げる局面がありうる、と述べています。

論考が持ち出したのはチェスの例です。Forbesの報道によれば、1997年にIBMのDeep Blueが世界王者Garry Kasparovに勝ち、その後10年以上は人間とAIの混成チームが最強でしたが、2017年までにAI単独がその混成チームを追い抜きました。医療も同じ曲線をたどるというのが論考の見立てで、ただしチェスの棋士が直面しなかったひねりがあると指摘しています。医師がAIに認知作業を預けるほど自身の技能が失われ、いざ人間に戻すことが難しくなる、という点です。

データを比較しながら判断する場面のイメージ

反対の見方も同じ報道の中で紹介されています。医療とAIをめぐる論者として知られるRobert Wachterは2026年の著書で、最上位の医療はAIを使いこなす医師が担い続け、AI単独の医療はいわば普及帯を担うという見方を示しています。米国医師会と米国内科学会は、患者の利益を最大にし害を最小にするため、AIは補助的な役割にとどまるという立場を維持しています。あわせてForbesは、Neal Khoslaの父であるVinod KhoslaがOpenAIの初期投資家であり、この関係が論考の利益相反の開示に記載されていたことも伝えています。読み手としては、この開示の存在を踏まえて内容を受け取る必要があります。

今後の動き、制度と責任の議論が先に来る

技術的な性能の議論と、実際に自律型AIが単独で医療を担えるかという制度の議論は別物です。Forbesの報道によれば、論考の執筆者自身も、責任の所在、診療報酬、規制という未解決の壁が残っており、現時点では人間の医師を介さない医療提供には至っていないと述べています。性能が先に到達しても、制度が追いつくまでには相応の時間がかかるという構図です。

士業事務所の立場から見ると、この議論は他人事ではありません。士業には業務独占という制度上の枠があり、有資格者の関与を外すという話にはならないため、医療の議論をそのまま持ち込むことはできません。一方で、AIの下書きに事務所側が確認を重ねる工程が、本当に品質を上げているのかという問いは共通します。確認が形だけになっていれば工程が増えるだけですし、確認する側の技能が落ちれば、検証そのものが機能しなくなります。当媒体でもこれまで、生成AIの架空判例をどう検証するかや、AIエージェントが文脈圧縮で運用ルールを取りこぼす問題を扱ってきましたが、いずれも「誰が何を見るか」を工程として定義できているかが分かれ目でした。

今後の注目点は3つに整理できます。1つ目は、AI単独とハイブリッドを比較した研究がどこまで蓄積されるかです。2つ目は、責任の所在をどう設計するかという制度側の応答で、これは士業のAI活用にも波及します。3つ目は、AI起因のスキル低下をどう測るかという評価手法の確立です。事務所単位でも、確認工程の有無で成果物の品質がどう変わるかを記録しておく段階に入っていると考えられます。この観点はNIST AI RMFを事務所のガバナンス構築に落とし込む記事とも重なります。

まとめ

JAMAに掲載された論考は、自律型AI単独が医師とAIのハイブリッドを上回りうると述べ、2030年ごろには一部の臨床業務で実用段階に達すると予測しています。米国医師会と米国内科学会は補助的役割にとどめる立場を維持しており、責任や規制の課題も未解決です。士業事務所にとっては、人間の確認を挟めば品質が上がるという前提を、工程として検証できているかを見直す材料になります。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: Forbes

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。