NVIDIAが話者分離AI無償公開、最大8人対応でベンチマーク1位

NVIDIAが最大8人を識別する話者分離AIを無償公開しました。ベンチマークで1位を記録した精度と、士業事務所の議事録作成や機密性確保への活用可能性を解説します。

オープンウェイトAIが毎秒670トークン、NVIDIA新モデルと士業の選択肢

NVIDIAは2026年9月23日、最大8人を識別する話者分離AIを無償公開しました。

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。NVIDIA公式の発表資料と一次報道を基に内容を確認しています。The Decoderが2026年9月27日に報じたところによると、NVIDIAは同月23日、会議や通話の音声から「誰がいつ話したか」を判定するAIモデル「Nemotron 3 Diarization」を無償公開しました。オープンウェイトで商用・非商用ともに利用でき、士業事務所が録音した打合せや聴取の記録作業にも応用できる技術です。

VoiceArenaベンチマークで比較したモデル別の話者分離エラー率を示すグラフ

何が起きたか・8人まで識別しベンチマーク1位の精度

Nemotron 3 Diarizationは、パラメータ数約1億の話者分離モデルです。最大8人の発言者を識別でき、複数人が同時に話す場面も検出します。ストリーミングとオフラインの両方の推論に対応し、遅延の設定は0.32秒から30.4秒まで4段階から選べます。

このモデルはベンチマーク「VoiceArena Diarization Benchmark v1」で1位を獲得し、エラー率14.72%を記録しました(出典: The Decoder)。1.04秒の遅延設定で比較すると、前身モデルの「Streaming Sortformer」から平均41%のエラー削減を達成しています(出典: The Decoder)。訓練データには英語・標準中国語・ヒンディー語など約21言語の音声が含まれており、多言語混在の会話にも対応します(出典: NVIDIA公式Hugging Faceブログ)。

利用条件については、NVIDIA公式のHugging Faceブログで「商用・非商用の両方で利用可能」と説明されています。ライセンスは「OpenMDW License Agreement, version 1.1」が適用されます(出典: NVIDIA公式Hugging Faceブログ)。想定用途として、Web会議・コールセンターの通話・ポッドキャストなどの音声認識パイプラインが挙げられています。

なぜ重要か・議事録作成と機密性の両立という視点

生成AIの分野では大規模モデルの開発競争が続く一方、今回のような小規模で特定機能に特化したモデルの無償公開が相次いでいます。パラメータ数を抑えつつ精度で上位に立つモデルが増えれば、自社のサーバーや限られた計算資源でも音声処理AIを動かせる事務所が広がる可能性があります。

士業事務所の実務に置き換えると、複数人が参加する打合せや聴取の録音を、発言者ごとに分けた記録に自動変換できる場面が想定されます。契約交渉や労務相談、税務のヒアリングなど、複数の関係者が同席する場面は珍しくありません。オープンウェイトで重みファイルを自社環境に置いて動かせる点は、録音データを外部のクラウドに送らずに処理できるという意味で、守秘義務を重視する士業事務所にとって選択肢の一つになり得ます。

データの取り扱いについては、NVIDIA公式の発表では、訓練に使われた音声データは公開データおよびライセンス済みの多数話者会話データ(David AI提供)であると説明されています(出典: NVIDIA公式Hugging Faceブログ)。一方で、利用者が実際に処理させた音声そのものが学習に再利用されるかどうかについては、公表資料からは明記されておらず、要確認です。事務所で導入を検討する場合は、この点を利用規約から個別に確認する必要があります。

今後の動き・音声認識との組み合わせが焦点に

NVIDIAは、この話者分離モデルを自社の音声認識モデル「Parakeet」と組み合わせることで、発言者ラベル付きの文字起こしを生成できると説明しています(出典: The Decoder)。単体の話者分離だけでなく、文字起こしと組み合わせた完成品としての活用が想定されている形です。

オープンウェイトモデルを実際の業務システムに組み込む動きは、他の開発者やサービス提供企業からも既に出てきています。今後は、こうした音声処理AIを議事録作成ツールや会議記録サービスに組み込む動きが広がるかどうかが注目点です。士業事務所がAIツールを選定する際は、精度の数値だけでなく、音声データの保存場所や学習への再利用有無を公表しているかどうかも、比較の材料になりそうです。

まとめ

NVIDIAは2026年9月23日、最大8人を識別する話者分離AI「Nemotron 3 Diarization」を無償公開しました。パラメータ数は約1億と小規模ながら、ベンチマークでエラー率14.72%を記録し1位となっています(出典: The Decoder)。オープンウェイトで自社環境での運用も可能なため、録音データを外部に出さずに処理したい士業事務所にとっても選択肢になり得る技術です。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: The Decoder

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。