Gemini 3.5 Transcribeは85言語対応の文字起こしモデルです。
Googleは2026年8月26日、公式ブログでGemini 3.5 Transcribeを公開しました。85言語以上を自動判別して文字に起こすモデルで、対応言語の一覧には日本語(ja-JP)も含まれています。面談や打合せの録音を文字に起こす作業は士業事務所の日常業務ですから、どこまで精度が上がったのか、そして預かった音声がどこに残るのかは気になるところです。この記事は公式ブログと公式ドキュメントに直接当たり、公表された事実と、事務所として確認しておきたい論点を分けて整理します。

Gemini 3.5 Transcribeで何が変わったのか
変わったのは、話し言葉を整った文章に直す処理がモデル側に入った点です。従来の音声認識は聞こえた音をそのまま並べるところまでが仕事で、フィラーの除去や体裁の整えは人間か後段のツールの担当でした。公式ブログはこのモデルについて、雑音や専門用語、言いよどみの整理に苦戦しがちな従来型と違い、生の音声を直接そのまま整形済みのテキストに変換すると説明しています。
提供形態は2系統です。マイクや通話をその場で文字にするリアルタイム用途はLive APIで gemini-3.5-transcribe-live を、録音済みの音声ファイルはInteractions APIで gemini-3.5-transcribe を呼びます。開発者向けにはGoogle AI Studio経由のGemini API、企業向けにはGemini Enterprise Agent Platformで、いずれもパブリックプレビューとして公開されました。
書き起こしの動作は2つのモードから選ぶ形です。既定の verbatim は一語一句をそのまま残し、「えー」「あの」といったフィラーや言い直しも保持します。もう一方の smart は、フィラーを落とし、「火曜、いや水曜に」のような言い直しをその場で解決し、段落や箇条書き、日付や金額の表記まで自動で整えます。公式ドキュメントによれば、話者分離は最大8名まで対応し、3名以上の話者への割り当ては実験的な扱いです。単語単位のタイムスタンプも出せますが、smart モードは話者分離とも単語タイムスタンプとも併用できないと明記されています。カスタム語彙は最大1,000語まで登録でき、100語程度までが効果的とされています。音声の長さは通常の要求で1時間まで、話者分離や単語タイムスタンプを有効にすると30分までという上限があります。
精度と速度の数字をどう読むか
公表された数字は、実務で使える水準に近づいたことを示しています。公式ブログは、Artificial Analysisの計測として、単語誤り率がストリーミングで平均4.0パーセント、非ストリーミングで2.6パーセントだったと記載しています。多言語のFLEURSベンチマークでは、上位の言語とロケールを対象にストリーミングで5.50パーセント、非ストリーミングで5.04パーセントとされ、いずれも従来モデルのChirp 3を上回ったと説明されています。速度面では、最終的な文字起こしが確定するまでの時間がChirp 3比で70パーセント改善したとされています。
ただし、これらは特定のベンチマーク上の平均値です。日本語の会議音声、複数人が重なって話す場面、法令用語や当事者名が頻出する場面で同じ数字が出るかどうかは、公表資料からは確認できません。導入を検討する事務所では、実際の録音を数本流して自前で確かめる段階だと考えられます。
士業事務所から見た4つの論点
生成AIの音声機能を事務所で使うとき、機能の話より先に確認されているのは次の4点です。
1つ目は、預けた音声がどこに残るかです。GoogleはZero data retentionの解説ページで、有料利用の場合はプロンプトや応答を製品改善に使わないと説明しています。一方で同じページには、Live APIでセッション再開の設定を使うと、テキストや音声、映像を含む会話状態が最大24時間保持されると書かれています。Files APIにアップロードしたファイルは利用者が削除するか期限切れになるまで保存され、Interactions APIは既定で状態を保存するため store を false にする必要があるとも記載されています。ログの既定保持期間は55日で、7日、14日、28日、55日から選べるとデータログの解説にあります。無料枠の扱いは有料と異なるため、どの契約形態で使うかが最初の分岐になります。生成AIへの情報入力とのつきあい方は顧客情報を生成AIに入力するときのリスク整理でも扱っています。
2つ目は、逐語と整形のどちらを残すかです。smart モードは読みやすい文章を返しますが、フィラーや言い直しが消えるということは、発言の揺れがテキスト上から見えなくなるということでもあります。後から発言の経緯をたどる可能性がある記録では verbatim を選び、整形版は別ファイルとして扱う運用が考えられます。この使い分けはAI議事録・文字起こしの実務でも整理しています。
3つ目は、専門用語と固有名詞です。カスタム語彙に事務所で頻出する法令名、様式名、関与先の商号を登録しておくと、聞き取りの揺れが減ることが期待できます。ただし関与先名を語彙として登録する行為そのものが情報の受け渡しにあたるため、何を登録するかは事前に決めておきたいところです。
4つ目は、録音そのものの説明と同意です。文字起こしの精度が上がるほど録音の機会は増えますが、相手にどう説明し、どの範囲で使うかは、技術とは別に事務所側で決めておく部分です。この点は面談録音と同意の運用ルールで詳しく扱っています。守秘義務との関係を先に整理してから機能を評価する順序は、生成AIと守秘義務の基本整理のとおりです。
今後の動き
公開範囲は広がる見込みです。公式ブログは、Chrome上の任意の入力欄で音声入力ができるようになると予告し、企業向けにはGemini Enterprise for Customer Experienceへの提供も近いとしています。AndroidのGboardではRambler機能として、macOS版のGeminiアプリでは音声からの操作として、すでに一般利用者向けに動いています。
日本語でsmart モードがどの程度自然な文章を返すか、処理がどの地域で行われるか、日本語ドキュメントの整備状況については、今回参照した公表資料からは確認できません。要確認として、実利用の前に自社の環境で試すか、Google側の地域に関する記載を改めて当たる必要があります。Geminiを事務所業務に組み込む全体像はGeminiの士業業務での使い方にまとめています。
まとめ
Gemini 3.5 Transcribeは、話し言葉を整った文章にするところまでをモデル側で担う音声文字起こしモデルです。85言語以上の自動判別、最大8名の話者分離、単語単位のタイムスタンプ、最大1,000語のカスタム語彙が公式ドキュメントに記載されています。士業事務所にとっては、精度の数字より先に、音声とログがどこに何日残るかという設定項目の確認が入口になります。
参考文献
- Google The Keyword「Intelligent transcription with Gemini 3.5 Transcribe」(2026年8月26日)
- Google AI for Developers「Audio transcription」
- Google AI for Developers「Zero data retention in the Gemini Developer API」
- Google AI for Developers「Data logging and sharing」
- Google AI for Developers「Gemini API Additional Terms of Service」
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: Google The Keyword
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。