オープンウェイトAIが最先端に接近 安全対策の差が残る現状と士業の視点

オープンウェイトAIが最先端モデルに4か月から7か月差まで接近との報告です。安全対策の差と、自前運用を検討する士業事務所が確認すべき論点を整理しました。

暗い画面に緑色の文字列が流れるイメージ

オープンウェイトAIの性能が最先端モデルに数か月差まで接近したとの報告が公表されました。

重みが公開されているAIモデル、いわゆるオープンウェイトモデルの性能が、主要ベンダーの最先端モデルに迫っているという評価が公表されました。TechCrunchが2026年8月4日に報じたもので、性能が近づく一方で安全対策の実装には開きが残ると指摘されています。自前の環境でAIを動かすことを検討する士業事務所にとって、判断材料が1つ増えた形です。本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。

コンピュータの基板に実装されたプロセッサ

報告書が示した性能差と拒否率の差

評価を行ったのはAI安全性を扱う非営利団体のSaferAIです。同団体の評価報告によると、中国のZ.aiが公開したオープンウェイトモデルGLM-5.2は、サイバーと生物分野の能力でOpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数か月差まで近づいています。評価は同社の公開APIを通じて実施されました。

差がはっきり出たのは、危険な依頼を断るかどうかの部分です。TechCrunchの記事によれば、GLM-5.2は与えられた攻撃的なサイバー課題と生物分野の課題を1つも拒否しませんでした。同じ記事では、Claude Opus 4.7について「拒否があまりに一貫していたため、SaferAIはCyberGymを完了できなかった」と紹介されています。CyberGymはサイバーセキュリティ能力を測るベンチマークです。

SaferAIは、Z.aiが安全性のフレームワーク、公開前テストの方針、リスク評価のいずれも公表していないと指摘しています。同団体のエグゼクティブディレクターであるHenry Papadatosは、能力の最前線とリスクの最前線は別物であり、対策の実装状況まで見て初めてリスクを評価できるという趣旨の発言をしています。

追いつきの速度も数字で示されている

差が縮まるスピードについては、英国の政府機関の分析があります。

AI Security Instituteは、GLM-5.2やDeepSeek V4-Proといったオープンウェイトモデルが、クローズドな最先端モデルにサイバー能力で4か月から7か月遅れの位置にあるとしています。2025年初頭の時点では6か月から10か月の差があったため、1年あまりで差が縮まった計算になります。

なお、脱獄への耐性という点では、クローズドなモデルも万全ではありません。前掲のTechCrunchの記事では、AI安全性の非営利団体Far.aiがxAIのGrok 4.5やGoogle DeepMindのGemini 3.1 Proを含む最先端モデルに数百件の汎用的な脱獄手法を見つけたと紹介されています。ロールプレイ、権威になりすます指示、偽の会話履歴、追い打ちの質問を組み合わせたときに成功しやすいと説明されています。

事務所が読み替えるべき論点

士業事務所がオープンウェイトモデルに関心を持つ理由は、たいてい情報の取り扱いにあります。自前のサーバーや端末で動かせば、顧問先の情報を外部のサービスに送らずに済むという発想です。

今回の報告が示しているのは、その裏返しの性質です。重みをダウンロードして自前の環境で動かした時点で、提供元がAPI側に置いていた拒否の仕組みや分類器は効かなくなります。前掲のTechCrunchの記事も、保護の除去や改変、ファインチューニング、システムプロンプトの差し替えが利用者側で可能になると説明しています。外部送信を避けられる代わりに、安全対策の設計と運用が事務所側の責任範囲に移るということです。

そのため、ツールを比べるときの観点は性能だけでは足りません。誰が安全対策を担うのか、その対策が公表されているのか、更新は誰の手で行われるのかまで見る必要があります。クローズドなモデルを使う場合はベンダーの公表資料が判断材料になりますが、オープンウェイトを自前で動かす場合は、その材料を事務所が自分で作ることになります。モデルごとの性格の違いはChatGPT・Claude・Gemini比較で、事務所内に情報を置いたまま検索する構成は士業事務所のRAG構築で扱っています。

情報が漏れる経路そのものも整理しておくと判断しやすくなります。外部送信だけが論点ではなく、端末の管理や共有設定が起点になる例もあります。この点は生成AIの情報漏えいはどこで起きるかにまとめています。

まとめ

オープンウェイトモデルの性能は最先端に数か月差まで近づき、英国の政府機関の分析では4か月から7か月の差とされています。一方で、危険な依頼を拒否する仕組みや公開前のリスク評価には開きが残っています。自前で動かす選択は外部送信を避けられる反面、安全対策の担い手が事務所側に移ります。導入を検討する段階では、性能表よりも対策の所在を確認する作業が効いてきます。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: TechCrunch

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。