Anthropicが安全分類器の1年停止を自ら公表、事務所のAI選定3視点

Anthropicが2026年8月のリスクレポートで、生物兵器関連の遮断分類器が約11か月機能していなかったと公表しました。事務所のAIベンダー選定で見るべき3視点を整理します。

Anthropicが安全分類器の1年停止を自ら公表、事務所のAI選定3視点

Anthropicが自社の安全分類器の約11か月の停止を公表しました。

AIベンダーが「自社の安全機構が約11か月にわたって働いていなかった」と自ら書いた文書が公開されました。Anthropicが2026年8月14日に公表したRisk Report: August 2026です。事務所で生成AIを使う立場から見ると、注目すべきは事故そのものよりも、その事故が長期間にわたって誰にも気づかれなかった経路のほうです。この記事では、公表された事実関係を整理したうえで、士業事務所がAIベンダーを見るときの視点を3つに分けて考えます。なお本記事は、公表資料と報道で確認できた範囲の事実のみを扱っています。

何が起きたか、リスクレポートに書かれた事実関係

結論から書くと、生物・化学兵器に関する応答を遮断するための分類器が、Anthropicの人間フィードバック用の基盤を通るトラフィックに対して適用されていなかった期間がありました。レポートの第4章に、「人間フィードバックのベンダートラフィックが遮断用の生物分類器なしで実行されていた」という項目が立てられています。

期間と規模を報じたThe Next Webによれば、対象は2025年5月から2026年4月まで、およそ5万人が利用し、約1億3,300万件のやりとりが該当しました。作業者の審査を担っていたのは外部のベンダーで、Anthropic自身ではありません。同記事は、その一部のベンダーが最も低い区分の脅威主体すら止められる審査体制を持っていなかったとレポートが記している、と伝えています。

仕組みの部分がより重要です。本来は社内用として設けられたフラグが、遮断の動作だけでなくログ記録まで同時に無効化していたため、該当したトラフィックはレビューの仕組みに一切渡っていませんでした。つまり、機構が止まっていること自体が観測できない状態が続いていたことになります。

Anthropicは発覚後、対象期間の入力をClaude Sonnet 5で全件再走査し、高リスクと判定された1,197件のうち、自社チーム由来と意図的なレッドチーミング由来を除いた62件を人が読んだと説明しています(出典: The Next Web)。明確な誤用は見つからず、レポートは顧客への影響について「To be explicit, there was no impact on our customers.」と明記しています。

なぜ重要か、止まったことより気づけなかったこと

この件が重いのは、失敗の内容ではなく、失敗の見つけ方のほうにあります。Anthropicは同じレポートで、今回の発見によって「これに類する、まだ把握していない問題が他にも存在する可能性が高まった」という趣旨の評価を書き、化学・生物兵器に関する全体のリスク評価を従来より一段引き上げています。加えて、2026年2月に公表した最初のリスクレポートの自己評価も、人間フィードバックの基盤をリスク面として数えていなかったとして事後的に修正しました。安全性の報告書が、前回の安全性の報告書を訂正した形です。

同じ基盤ではもう一件、別の事象も開示されています。2026年4月、外部からの情報提供をきっかけに、データラベリングの委託先の一部作業者が不備を突いてAPIキーを取得し、割り当て外のモデルを使っていたことが確認されました。その経路が数週間開いており、把握から90分で封じ込めて同日に経路を閉じたとレポートが説明している、とThe Next Webは報じています。モデルの重みの持ち出し、顧客データへの到達、中核ネットワークへの侵入はいずれも確認されていません。

もうひとつ特徴的なのが、レポートの草案をClaudeにレビューさせ、そこで出た批判をそのまま本文に載せている点です。自社にとって不利な指摘を残したまま公開する運用は、開示の姿勢を測る材料になります。Axiosは同じレポートについて、未公開の内部モデルの存在とアラインメント評価の引き上げを中心に報じています。

士業事務所がAIベンダーを見るときの3視点

ここから先は、事務所で生成AIを使う立場での見方です。今回の公表内容は日本の制度変更ではありませんし、顧客トラフィックへの影響も否定されています。それでも、ベンダー側の内部統制がどこまで自分たちの前提になり得るのかを考える材料にはなります。

第一に、ベンダー側の安全機構を「動いている前提」で数えない、という置き方があります。今回の件は、遮断とログが同じフラグで同時に落ちるという設計上のつながりによって、異常が観測できない期間が生まれた事例でした。事務所側でも、どのやりとりをいつ誰が行ったのかを自前で残す記録が、外部の仕組みとは独立に必要になるという整理をする事務所があります。

第二に、委託の連鎖をどこまで把握するか、という論点です。今回データに触れていたのは、Anthropicが直接雇用した人ではなく、外部ベンダーが集めた作業者でした。士業事務所の側でも、外注やBPOに業務を出す際、直接の契約相手のさらに先まで含めて誰が資料に触れるのかを確認しておくことが、守秘義務との関係で論点になります。生成AIの利用そのものより、その周辺の委託構造のほうが確認しにくい部分です。

第三に、開示の質そのものを評価軸に入れる考え方です。自社に不利な事実を、期間と件数を伴った形で出し、外部の批判を本文に残せているかどうかは、ツール選定の判断材料のひとつになります。逆に言えば、こうした報告を公表していないベンダーについては、同種の問題が無いことの確認材料が少ない、という状態になります。

なお、データの取り扱いについては、今回のレポートで扱われているのは人間フィードバック用の基盤という顧客向けではない経路であり、顧客データへの影響は否定されています。入力データが学習に使われるかどうかの条件は契約形態や提供プランによって異なるため、事務所での利用可否を判断する場面では、各ベンダーの公表しているポリシーを個別に確認する段階になります。

まとめ

Anthropicは2026年8月14日のリスクレポートで、生物兵器関連の遮断分類器が人間フィードバック基盤で約11か月適用されていなかったこと、その間ログも残っていなかったことを公表しました。顧客への影響は否定されていますが、同社は同種の未把握の問題がある可能性を認めています。事務所の側では、記録の自前確保、委託の連鎖の把握、開示の質という3つの視点が、ツール選定の材料になります。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: The Next Web

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。