Anthropicが運用会社BAMのAI評価と統制の事例を公開しました。
Anthropicは2026年9月17日、運用会社バリアズニー・アセット・マネジメント(BAM)のチーフAIオフィサーへの取材記事をClaudeのブログで公開しました。話の軸は二つです。新しいモデルを業務に入れる前に何をどう測ったか、入れたあとは何で縛っているか。一般的なベンチマークではなく自社の実務課題で測り、モデルの外側に権限とログの仕組みを置く、という組み立てになっています。規模も業種も違いますが、道具の選び方と任せ方という点では士業事務所の実務にも重なります。本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で確認しています。

一般ベンチマークを使わず、自社の実務課題で測った
BAMが新モデルの採否を決めた材料は、一般公開のベンチマークではなく自社の実務課題でした。同社は株式・マクロ・コモディティにまたがる数千件の金融タスクで新モデルを試しており、いずれも結果の正誤を検証できる課題だと取材記事に記されています。同社は約380億ドルの資産を運用し、約2,000人の運用担当者とスタッフを抱える多戦略運用会社です。
測り方も二段構えです。モデル単体の性能に加えて、実際の利用者と同じツール・ファイル・要件を与えた自社のエージェント環境の中でも試しています。見ているのは、作業を計画できるか、適切なツールを選んで使えるか、根拠を探して分析できるか、失敗から復帰できるか、途中結果を自己点検できるか、根拠の伴う成果物を出せるか。逆に、数値の誤り、見落とし、根拠のない結論、検索や取得の失敗といった特定の失敗の型も探しています。結果は、対象となる部分集合でClaude Fable 5が89.4%、それまで本番で使っていたモデルが86.1%だったと同記事は伝えています。差が出たのは複雑な計画立案と分析、そしてエージェントとしての実行でした。
興味深いのは、社内で誰も解けたことのなかった経済学の問題群を新モデルが解いたときの扱いです。同社はまず評価側の不具合を疑い、評価を再実行し、課題と採点ロジックを独立に点検し、Anthropicと結果を突き合わせたうえで改善が本物だと結論づけた、と記事には書かれています。良い数字が出たときほど測定側を疑うという順序は、AI導入の効果をどう測るかで触れた効果測定の設計にもそのまま当てはまります。
士業事務所にとっての3つの論点
ここからは士業事務所の側に引き寄せて読みます。論点は3つあります。
一つめは、評価の物差しを自分の書式で持てているかどうかです。BAMが使ったのは一般ベンチマークではなく、正誤を検証できる自社の実務課題でした。士業事務所に置き換えれば、自所の契約書・申告データ・就業規則・登記申請書といった実物で試した結果が、モデルの乗り換え判断の材料になります。公開ベンチマークの順位が、日本語の実務書式での挙動をそのまま示すとは限りません。この考え方はAIツールのベンダーに何を聞くかで整理した確認項目とも接続します。
二つめは、能力が上がっても権限は自動で広げない、という切り分けです。BAMは統制をモデルの選定とは別の問題として扱い、承認済みのデータ境界、最小権限、ツール単位の許可、ログと追跡可能性、重要な成果物への人のレビュー、例外時のエスカレーション経路を置いていると説明しています。より高性能なモデルだからといって権限が広がるわけではなく、利用者と作業ごとに承認されたツールとデータしか使えず、モデルが自分で権限を増やすことはできない、という建て付けです。加えて、利用範囲を広げる前に敵対的なシナリオや失敗シナリオを試しているとも述べています。この設計はAIエージェントを事務所に入れる前に決める権限とログの7チェックやAIエージェントの実行制御とはで扱ってきた論点と同じ方向を向いています。
三つめは、時間が縮んだあとに人の確認をどこへ置くかです。合併裁定の分析では、案件が発表されるとエージェントが初期の分析パッケージを組み立て、成立確度と所要期間を見積もり、主要な経済条件と法的条件を抜き出し、条件とマイルストーンを特定し、投資判断が要る箇所に印を付けます。この作業は従来3日から5日かかっていたものが1日未満になり、エージェント自体の実行は約30分、重要な成果物を使う前には人のレビューが入ると記事は伝えています。士業の成果物は資格者の名義で外に出るため、短縮の前後で「誰が何を突き合わせるか」の置き場所が動きます。守秘義務の根拠条文は職種ごとに置かれており、弁護士法第23条は秘密保持の権利及び義務を、税理士法第38条と公認会計士法第27条は秘密を守る義務を定めています。個別の入力や運用がこれらの条文との関係でどう評価されるかは、有資格者の判断領域です。
入力データの取り扱いは公表資料のどこを見るか
今回の取材記事は評価と統制の進め方を扱ったもので、入力データを学習に使うかどうかや保存期間には触れていません。その点を判断したい場合は、Anthropicのプライバシーポリシーとプライバシーセンター、セキュリティと法令順守の状況をまとめたTrust Centerが公表資料にあたります。
ただし、入力の学習利用や保持期間の扱いはプランや契約形態によって変わります。日本の事務所が実際に契約する条件でどうなるかは、今回の記事からは読み取れないため要確認です。顧問先の情報を入れる前に、自所の契約でどの条件が適用されるかを書面で押さえておく、という運用を採る事務所があります。ログの保管と説明の型については事務所のAI利用ログを監査証跡にするで整理しています。
エージェントを載せる場所を先に用意する動き
BAMはエージェントを個別に動かすのではなく、承認済みの業務フローに安全に載せるための社内基盤としてBAMAgentを作っています。必要なツールとシステムだけを与える設計で、開発を始めて6か月、数千体の自律エージェントが24時間動いていると取材記事は伝えています。チャットが情報の取り込みと整理を担うのに対し、こちらは数時間から数日にわたる多段階の調査と分析を並列で走らせ、人がレビューできる成果物で終わる、という役割分担です。
成果の例も具体的です。税務上の損失計上の分析では、エージェントが90,000のデータベーステーブルを探索して該当する投資信託の保有データを見つけ、独自の重み付けを組み立て、チームのレビューを経て従来の手法より網羅的な結果になったとされています。同社のチーフエコノミストは、約2日かかっていた中央銀行分析の定例作業を約30分に縮める作業手順を組み、レビューと判断は本人が持ち続けているとも記事に書かれています。300体を超えるエージェントを回しているチームもあるとのことです。
事務所の規模ではこの数はそのまま参考になりませんが、方向は読み取れます。エージェントの数が増えるほど、どこに載せるか、どこまで触れるか、誰が最後に見るかを先に決めておく余地が大きくなります。AIの挙動をAIで見張る動きについてはAIエージェントをAIで見張る動きが拡大で、導入から本番移行までの段取りについてはAnthropicが本番移行の設計図を公開で扱いました。評価を仕組みとして内側に持つという論点はAnthropicがAI評価者を社内常駐へとも重なります。
まとめ
今回公開された事例の芯は、モデルを信用するのではなく、モデルの外側に置いた仕組みを信用する、という組み立てにありました。自社の実務課題で測り、能力が上がっても権限は自動で広げず、重要な成果物には人のレビューを残す。士業事務所が同じ規模の基盤を作る話ではありませんが、道具を替えるときの判断材料をどこから取るかという点では、そのまま持ち帰れる考え方です。
参考文献
- Claude by Anthropic「Working at the frontier: How Balyasny Asset Management evaluates and governs Claude Fable 5」
- Anthropic「Claude Fable」
- Claude「Financial services」
- Balyasny Asset Management 公式サイト
- e-Gov法令検索「弁護士法」
- e-Gov法令検索「税理士法」
- e-Gov法令検索「公認会計士法」
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: Claude by Anthropic
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。