AI評価を専業とするValsが、4,000万ドルを調達しました(出典)。
AIモデルの性能を測る側の企業に、大型の資金が入りました。TechCrunchが2026年9月19日に報じたところによると、AI評価を専業とするValsが、Andreessen Horowitz主導のシリーズAで4,000万ドルを調達しました。同社は法務・金融・コーディングといった業種別の実務タスクでモデルを評価する会社で、法務領域では法務AI製品を横並びで比較したレポートを公表してきました。ベンダーの自己申告ではなく第三者の測定でAIを選ぶ流れが、士業事務所のツール選定にも関わってきます。
Valsが測っているのは「試験の点数」ではなく実務の成果物
Valsが狙っているのは、学術的な知識テストではなく、実務タスクでの評価です。TechCrunchの取材に対し、共同創業者のRayan Krishnanは、従来の評価が「司法試験のようなテストを解けるだけの知識があるか」という抽象的な知能の測り方に寄っていたと述べています。これに対してValsは、法務・金融・コーディングなど特定業種の複雑な業務をモデルが完遂できるか、人間と同等の品質の成果物を出せるかを見る設計を採っています。
同社は2024年設立で、8VCとBloomberg Betaが主導したシード調達を経て、2026年8月にシリーズAを実施しました。citybizによれば、調達額は4,000万ドル、評価額は4億ドルで、既存投資家の8VC、Pear VC、Bloomberg Betaに加え、HRT VenturesとNext Ladder Venturesが新規に参加しています。同社は収益が前年の8倍になったとTechCrunchに説明しており、年初に8名だった社員数は25名まで増え、さらに10〜15名の採用を計画しているとしています(いずれも出典はTechCrunch記事)。
設計上の特徴として、Valsはテスト問題そのものを公開していません。公開ベンチマークはモデル側がテスト内容に向けて最適化できてしまうためで、同社は非公開の試験材料を継続的に更新する方針を採っています。収益構造については、Krishnanは受験者が試験団体に受験料を払う仕組みになぞらえて説明しており、モデルを出す側が評価を買う形になっています。

士業にとっての論点は「誰が測り、誰が参加しなかったか」
日本の士業事務所がこのニュースから読み取れる論点は、評価結果の数字そのものより、その評価に誰が参加したかにあります。Valsは法務領域でVals Legal AI Report(VLAIR)を公表しており、2025年2月の第1回ではHarvey、Thomson ReutersのCoCounsel、vLexのVincent AI、VecflowのOliverが対象になりました。2025年10月には法律調査に絞った続編が出ています。
この続編の内容を報じたLawSitesによると、正確性50パーセント・典拠性40パーセント・適切性10パーセントの重みづけで210問を評価した結果、弁護士ベースラインの正確性が平均71パーセントだったのに対し、Alexiが80パーセント、Counsel Stackが81パーセント、Midpageが79パーセント、ChatGPTが80パーセントという数字が出ました。一方で典拠性はChatGPTが70パーセント、法務特化AIの平均が76パーセントと差がつき、複数法域にまたがる設問では全システムが平均11ポイント低下したとされています。弁護士側が上回ったのは、先例を区別したり相反する権威を整理したりする解釈的な設問群でした。
ただし同記事は、Thomson Reuters、LexisNexis、vLexという規模の大きい3社が参加を見送った点も指摘しています。ここが実務上いちばん重要なところで、ランキングの上位が「最も優れた製品」ではなく「参加した製品のうち上位」であるという読み方が要ります。評価の独立性という論点は、Anthropicが外部評価者を置いた件や運用側が自前でモデル評価の枠組みを持つ動きとも地続きです。
もう一点、データの取り扱いにも触れておきます。Valsが試験材料を非公開にしているのは最適化を避けるためですが、事務所が自前で同じことをやろうとすると、実案件の書面を評価用データに使うかどうかが守秘義務と事務所規程の論点になります。ベンダー側の学習利用方針についても、公表されているポリシーで確認する必要があり、この記事で扱った各社の日本語での提供条件までは公表資料から確認できません。

今後の動きと、事務所が今できること
Krishnanは、AI企業の株式公開が進むなかで、評価やベンチマークが公開資料や投資判断の一部になっていくという見通しをTechCrunchに語っています。同社は連邦機関向けにモデル評価を提供するプログラムも始めており、評価が調達要件に組み込まれる動きが出てくる可能性があります。日本でも、士業向けAI製品について同種の独立した第三者評価が広く公表されている状況かどうかは、現時点の公表資料からは確認できません。
この流れを踏まえて、事務所の側で今できることをいくつか挙げます。第一に、ベンダーが示す性能数値について、誰が測ったのか、どの製品と比べたのかを確認する対応を採る事務所があります。第二に、VLAIRのような海外の評価は米国法の調査を前提にしているため、日本法の調査能力にそのまま当てはめずに扱う段階です。第三に、自前で比較する場合は、匿名化した設問を数問用意して複数ツールに同じ問いを投げる方法が現実的で、この際の設問づくりと守秘義務の扱いはベンダーへの確認質問リストと併せて整理しておくと判断がぶれにくくなります。
法務特化のモデル提供自体も動いており、OpenAIが法務向けモデルを投入した件のように、比較対象は短期間で入れ替わります。ひとつの評価結果を長く持ち続けるよりも、評価の読み方の型を持っておくほうが実務では使えます。
まとめ
AI評価を専業とするValsが4,000万ドルを調達し(TechCrunch)、法務を含む業種別の実務タスクでモデルを測る事業を拡大しています。同社が公表してきた法務AIの比較レポートでは、正確性で弁護士ベースラインを上回る数字が出た一方、大手3社が参加を見送っていました(LawSites)。数字の高さより、誰が測り誰が参加しなかったかを見る読み方が、事務所のツール選定では効いてきます。
参考文献
- TechCrunch「Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking」
- citybiz「Vals AI Raises $40M to Expand Independent AI Benchmarking」
- LawSites「Vals AI’s Latest Benchmark Finds Legal and General AI Now Outperform Lawyers in Legal Research Accuracy」
- Vals「Vals Legal AI Report」
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: TechCrunch
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。