Artificial Analysisが、自分のタスクからAIベンチマークを作れるOptimaを公開しました。
AIモデルの性能比較といえば、これまでは公開ベンチマークのスコア表を眺めるしかありませんでした。ところが、AIモデルの評価指標を発信してきたArtificial Analysisが、自分の手元にあるタスクからベンチマークそのものを組み立てられるOptimaを公開しています。汎用スコアではなく、自分の業務でどのモデルが働くかを測るための道具です。この記事は生成AI(Claude)が公表資料をもとに書いており、士業のチカラには監督する有資格者はいません。事実関係は末尾の参考文献から原典をご確認ください。
Optimaで何ができるようになったか
Optimaは、自分のデータやタスクからカスタムベンチマークを組み立て、複数のAIモデルを同じ条件で走らせて採点する仕組みです。公式ページは「標準化されたベンチマークはモデルの一般的な能力を測るものであり、自分の特定のユースケースにどのモデルが適しているかまでは示さない」という趣旨の問題意識を掲げています。
流れは四段階に整理されています。まず、やらせたい仕事を文章で説明するか、良い成果物の例を数点添付すると、構築用のエージェントがタスクと採点基準の草案を書きます。既存の可観測性ツールに溜まったエージェントの実行履歴を取り込む方法や、手元のコーディングエージェントから作る方法も用意されています。次に、評価の型を選びます。正解が決まっている質問応答、アップロードしたファイルについて答えさせる形式、ツールを使いながら成果物を作らせるエージェント形式の三つが現時点で選べ、利用者との対話をシミュレートする形式は近日公開とされています。
三段階目が実行です。同じタスク、同じ条件で選んだモデルを走らせ、タスクごとにトークン量、コスト、所要時間が記録されます。自前のエージェントをHTTP経由で同じ実行に参加させ、フロンティアモデルと同じ土俵で比べることもできます。最後が採点で、独自の採点基準ごとに判定させるか、主要な評価で使ってきた判定モデル群による一対比較でモデル同士を順位付けするかを選べます。結果表にはスコアに加えてタスクあたりのコストと時間が並び、品質と費用の釣り合いを見て決められる作りになっています。
料金は従量制で、月額の契約は不要とされています。ベンチマークの作成と実行はモデルのトークン実費に上乗せなし、採点は基準ごとの判定が1基準あたり0.125ドル、一対比較は1マッチあたり0.375ドルと公式ページに記載されています。各段階の開始時にコスト見積もりに基づいてクレジットを仮押さえし、終了時には実際に使った分だけを請求する方式です。
汎用スコアでは埋まらない差が可視化される
このプロダクトが重要なのは、AIモデル選定の議論を「一般にどれが賢いか」から「うちの仕事でどれが働くか」へずらす道具だからです。公開ベンチマークの上位モデルが、自分の扱う文書や業務フローでも上位とは限りません。文書の様式、専門用語、求める出力の粒度が違えば順位は入れ替わり得ます。
もうひとつの論点は、スコアと同時にタスクあたりのコストと時間が並ぶ点です。実務では、最高スコアのモデルよりも「十分な品質を桁違いに安く出すモデル」を選ぶ場面のほうが多く出てきます。公式ページも、品質だけでなくコストと時間の効率を並べて比較できることを訴求の中心に置いています。前回取り上げたAI投資と資本の動きの話と合わせると、モデルの価格と性能が短い周期で動く局面で、自分の基準を持っておく価値は上がる方向にあります。
興味深いのは、公式ページが例として掲げるベンチマークのひとつが契約書レビューだという点です。供給業者との契約からリスクのある条項を指摘し、条件を抽出させるタスクを組み、モデルを比べるという想定が置かれています。士業事務所の業務と重なる領域が、こうしたツールの標準的なユースケースとして扱われ始めているわけです。
士業事務所から見たときの論点
士業事務所がこの種の仕組みを検討するときに、最初に立つのがデータの取り扱いです。Optimaは自分のデータや実行履歴をアップロードして使う設計なので、そこに何が入るかがそのまま守秘義務の論点になります。公開されているOptimaの紹介ページからは、アップロードしたデータが学習に使われるかどうかの方針は確認できませんでした。導入の可否を判断する場面では、Artificial Analysisのプライバシーポリシーや利用規約の該当箇所を自分で確認し、必要ならベンダーに直接照会する段階だと考えられます。
実務上の折り合いのつけ方としては、実データを避けて評価用の擬似データを組む運用を採る事務所があります。過去案件から個人情報や依頼者を特定できる情報を取り除き、様式と難易度だけを再現したタスクを二十件ほど用意して、それをベンチマークにするという発想です。契約書レビューのように様式が定型化している業務ほど、この作り方は現実的になります。
三つ目の視点は、評価を一度きりで終わらせないことです。モデルは数か月単位で入れ替わるため、比較の物差しを自分の側に持っておくと、新しいモデルが出るたびに同じタスクで走らせて判断できます。AIへの業務委任が広がっている調査結果と重ねて考えると、委任する範囲を決める前に自分の基準で測っておくという順番が、事務所にとっては扱いやすい進め方になりそうです。
今後の動き
カスタムベンチマークを自前で組む流れは、Optimaに限らず広がっていくとみられます。評価基盤を持つ事業者がセルフサービス化に踏み出したという点で、この動きは業界の関心の在り処を示しています。士業事務所としては、すぐに課金して使うかどうかよりも、「自分の事務所の仕事をタスクとして書き出せるか」という問いのほうが先に来ます。ベンチマークを作る作業は、結局のところ、自分たちの業務のどこを機械に任せ、何をもって合格とするかを言語化する作業だからです。その言語化ができていれば、どのツールを選ぶにせよ判断は速くなります。
まとめ
Artificial AnalysisのOptimaは、自分のタスクとデータからAIベンチマークを作り、モデルを品質とコストと時間の三軸で比べられる仕組みです。公式ページには契約書レビューが例として挙がっており、士業事務所の業務と重なります。一方で自分のデータをアップロードする設計のため、守秘義務との関係は導入前に確認が要る論点です。擬似データで物差しを作っておくところから始める考え方が現実的でしょう。
参考文献
- Artificial Analysis Optima 公式ページ
- Artificial Analysis プライバシーポリシー(PDF)
- Artificial Analysis LLM Leaderboard
- AlphaSignal「Artificial Analysis’ Optima Lets Any Team Build Custom AI Benchmarks」
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: Artificial Analysis
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。