Gemini 3.5 Flash を士業事務所で使う コスト構造と用途別6基準

Gemini 3.5 Flash の公式価格から入力・出力・キャッシュ・グラウンディングの4層を整理し、士業事務所が作業をモデルに振り分ける6基準と規程の書き方を解説します。

Gemini 3.5 Flash を士業事務所で使う コスト構造と用途別6基準

Gemini 3.5 Flashとは、Googleの高速なAIモデルのことです。

同じ作業を、どのモデルに投げるかでコストが数倍変わります。士業事務所の生成AI利用は、条文の要約、書面の下書き、議事録の整形、大量の資料からの抽出と、性質の違う作業が混在するため、1つのモデルに寄せると割高になる場面が出ます。本記事では、Gemini Developer APIの公式価格表を出発点に、Gemini 3.5 Flash をどの作業に当て、どこで上位や下位のモデルへ振り分けるかの基準を整理します。本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で確認しています。

Gemini 3.5 Flash の料金体系を4層で押さえる

結論から言うと、Gemini 3.5 Flash の課金は入力、出力、キャッシュ、グラウンディングの4層で構成されています。事務所の請求が読めなくなるのは、たいてい出力とグラウンディングの2層を見落としているためです。

前掲の公式価格表によると、Gemini 3.5 Flash の標準ティア有料版は、100万トークンあたり入力が1.50ドル、思考トークンを含む出力が9.00ドルと示されています。入力と出力で単価が6倍離れている点が、この世代の特徴です(出典: 同価格表)。長い資料を読ませること自体は安く、長い文章を書かせることが高い、という構造になっています。

コンテキストキャッシュは同表で100万トークンあたり0.15ドル、加えて1時間あたり1.00ドルの保管料が示されています。同じ資料に対して繰り返し質問する使い方であれば、キャッシュを効かせたほうが安くなる場面があります。逆に、資料を1度読ませて終わる使い方ではキャッシュの保管料が乗るだけになるので、使い分けが必要になります。

グラウンディングは見落とされやすい層です。同表には、Google検索によるグラウンディングについて、月あたり5,000回の検索リクエストが無料で、これはGemini 3系の各モデルで共有される、そして超過分は1,000リクエストあたり14ドル、と記載されています。事務所で複数人が最新情報の確認に使うと、この無料枠は思ったより早く消えます。

処理モードによる差も大きいところです。前掲の価格表は、バッチ処理とフレックス処理について、入力0.75ドル、出力4.50ドルと標準の半額の水準を示しています。即時の応答を求めない一括処理、たとえば夜間に大量の書面を分類する用途では、この差が効きます。

さらに上のティアもあります。同じ価格表には優先処理の区分が設けられており、Gemini 3.5 Flash では標準より高い単価が提示されています。応答の待ち時間を短くしたい業務があるかどうかで選ぶ層で、士業事務所の一般的な用途では標準ティアで足りる場面が多いところです。ここを最初から選ぶと、体感の差より請求の差のほうが大きく出ます。

4層のうち、事務所が最初に手を付けるべきは出力層です。入力を減らす工夫は資料の整理という面倒な作業を伴いますが、出力を減らす工夫は指示文の書き方だけで済みます。「要点を5つ」「300字以内」のように出力量を指定するだけで、思考トークンを含む出力の消費が変わります。単価表を眺める前に、まずここを見直すほうが早く効きます。

用途別にモデルを振り分ける6基準

事務所の作業をモデルに割り当てるとき、判断軸は6つに整理できます。

第1基準は、出力の長さです。前掲の価格表が示すとおり出力単価が入力の6倍になるため、長文を生成させる作業ほどモデル選定の影響が大きくなります。要約や分類のように出力が短い作業は、上位モデルを使っても総額が跳ねにくい。一方、書面のドラフト生成のように出力が長い作業は、モデルを1段下げるだけで請求が目に見えて変わります。

第2基準は、誤りの許容度です。条文や判例に触れる作業は、モデルの安さより検証工程の設計で決まります。実在しない条番号が出る問題は上位モデルでも起こるため、安いモデルを避ければ解決する話ではありません。止め方は生成AIの架空判例・架空条文を止めるで工程化しています。

第3基準は、投入する資料の量です。長い資料を扱う場合、前掲の価格表が示す上位モデルの価格帯が効いてきます。Gemini 3.1 Pro Preview の標準ティアは、20万トークン以下のプロンプトで入力2.00ドル、出力12.00ドル、20万トークンを超えると入力4.00ドル、出力18.00ドルと段階が分かれています。大量資料を読ませる用途では、この段差の手前に収まるよう資料を分割する設計が効きます。

第4基準は、処理の緊急度です。面談中に即答が要る用途は標準ティア、翌朝までに終わればよい用途はバッチ。この振り分けだけで、同じ作業の単価が半分になる計算になります。前掲の価格表のバッチ価格がその根拠です。

第5基準は、下位モデルで足りるかどうかです。同じ価格表には、Gemini 3.5 Flash-Lite の標準ティアが入力0.30ドル、出力2.50ドルと記載されています。高頻度の定型処理、翻訳、単純なデータ処理向けとされており、事務所でいえばメールの分類、資料のタグ付け、定型文の差し込みが該当します。判断を含まない作業をここへ落とすと、全体の請求が下がります。

第6基準は、外部に出せるデータかどうかです。これはコストではなく守秘義務の軸で、次の節で扱います。コスト最適化を先に走らせて、あとから投入不可のデータが混ざっていたと分かる展開が最も手戻りが大きいところです。

実務では、作業をモデルに振り分ける前に、作業自体を棚卸しする工程が要ります。次のプロンプトは、その棚卸しに使えます。

あなたは士業事務所の業務分析の補助です。以下の作業一覧について、
生成AIに投げる場合の設計を整理してください。

出力項目:
1. 想定される入力トークン量の大小(大/中/小)
2. 想定される出力トークン量の大小(大/中/小)
3. 即時応答が必要か(必要/不要)
4. 判断を含むか(含む/含まない)
5. 顧客情報を含むか(含む/含まない/マスクで回避可能)
6. 上記から推奨されるモデル階層(上位/標準/軽量)と理由

作業一覧:
"""
{ここに事務所の作業を1行ずつ列挙}
"""
表は使わず、作業ごとに箇条書きで出力してください。

キャッシュを効かせる設計に切り替える場面では、質問の投げ方を変えます。

あなたは士業事務所の資料読解の補助です。
以下の資料を前提として保持し、この後の複数の質問に一貫して回答してください。

資料:
"""
{長文資料をここに貼る}
"""

回答の制約:
- 資料に書かれていない事項は「資料に記載なし」と明示すること
- 条番号や日付を回答に含める場合、資料中の該当箇所を必ず引用すること
- 法的な評価や当てはめは行わず、資料の記載事項の整理にとどめること

なお、コスト設計をモデル単価だけで詰めると、事務所全体の判断を見誤ります。ChatGPT側の料金プランとの比較観点はChatGPT Goプランは士業に向くかで整理しているので、複数ベンダーを並べる段階ではそちらも合わせて見ると全体像が揃います。

無料枠と有料枠でデータの扱いが変わる点をどう規程に書くか

事務所として最初に確認したいのは、料金ではなくデータの扱いです。前掲の公式価格表には、製品改善への利用について、無料ティアが「Yes」、有料ティアが「No」と明記されています。同じモデルでも、どの枠で使うかで入力データの扱いが変わる建て付けだということです。

この差は、事務所の運用に直結します。担当者が個人のアカウントで無料枠を使い、顧問先の資料を投入した場合と、事務所が有料契約で使った場合とでは、データの扱いに関する前提が変わります。守秘義務の根拠は士業ごとに異なり、税理士であれば税理士法第38条に、正当な理由がなくて税理士業務に関して知り得た秘密を他に洩らし、又は窃用してはならない、と定めがあります。弁護士については弁護士法第23条に、職務上知り得た秘密を保持する権利を有し、義務を負う、と規定されています。

そこで規程には、モデル名ではなく契約形態で線を引く書き方が扱いやすくなります。事務所が契約した有料アカウント経由の利用に限る、無料枠および個人アカウントでの業務利用は対象外とする、という形です。モデル名で書くと、新モデルが出るたびに規程の改訂が発生します。

もうひとつ書いておきたいのが、グラウンディングの扱いです。Google検索によるグラウンディングを有効にすると、プロンプトの内容に応じた検索クエリが外部へ送られます。前掲の価格表も、顧客が送信したリクエストが1つ以上の検索クエリにつながり、個々の検索クエリごとに課金されると注記しています。顧問先名や案件固有の情報を含むプロンプトでグラウンディングを使う場合、何が外へ出るかを想定しておく必要があります。機能ごとに使用可否を分ける運用が現実的です。

3つ目は、アカウント管理です。個人アカウントの野良利用が残っていると、契約形態で線を引いた規程が機能しません。この論点は事務所のシャドーAI対策で扱っています。規程を書く順序としては、アカウントを事務所管理に寄せる作業を先に済ませ、そのうえでモデルの使い分けを設計するほうが手戻りが少なくなります。

4つ目は、顧問先への説明です。どのベンダーのどのサービスを使っているかを開示するか、使用の事実のみを伝えるかは方針が分かれます。契約書に再委託や外部サービス利用の範囲を書き込んでおく運用が採られています。ベンダーを乗り換える可能性を織り込むなら、社名を列挙するより、外部の生成AIサービスという括りで書いておくほうが改訂の手間が減ります。

5つ目は、記録の残し方です。誰が、いつ、どの案件の情報を、どのアカウントで投入したかを追える状態にしておきます。アカウントを事務所管理に寄せておけば、管理コンソール側の利用ログである程度は追えます。個人アカウントが混ざると、この追跡が成立しません。契約形態で線を引く規程は、この追跡可能性とセットで意味を持ちます。

なお、ベンダーごとの学習利用の条件は、プランの階層によって記載が分かれる例が多くあります。同じ社のサービスでも、個人向けと法人向けで条項が違うことは珍しくありません。公式ドキュメントの記載を確認日とともに保存し、改定を追う担当を決めておく運用の考え方は生成AIの法人プランと学習利用の比較に整理しています。

コスト設計でつまずいた3つの場面

ひとつ目は、思考トークンを見落とす場面です。前掲の価格表は、出力価格が思考トークンを含むと明記しています。推論の過程で消費されるトークンも出力として課金される建て付けなので、複雑な指示を投げるほど請求が伸びます。試算の段階で、出力の見積もりを画面に表示される文字数だけで置くと、実際の請求と乖離します。

ふたつ目は、グラウンディングを常時オンにする場面です。最新情報を確認したい気持ちは分かりますが、条文や過去資料の読解には検索が要りません。用途ごとに切り替える設計にしておくと、無料枠の消費が読めるようになります。

みっつ目は、安いモデルへ寄せすぎる場面です。軽量モデルで済ませようとして出力の手直しが増え、担当者の時間が伸びれば、単価の差は簡単に飲み込まれます。士業事務所は人件費の単価が高いので、モデル料金の最適化より、手直しの発生率を下げるほうが効く場面が多くあります。判断を含む作業は上位モデル、含まない作業は軽量モデル、という切り分けが実務的です。

費用と工数を見積もる 10人規模の事務所の場合

以下は実測値ではなく、前掲の公式価格表の単価から逆算した参考値です。実際の請求はトークン量に依存するため、初月は上限アラートを設定して実測することをおすすめします。

見積もりの手順は3段階です。まず、月間の作業件数と、1件あたりの入力・出力トークンの概算を出します(根拠となる単価は前掲の価格表)。次に、標準ティアとバッチのどちらで回すかを作業ごとに決めます。最後に、グラウンディングを使う作業を数え、無料枠に収まるかを確認します。この3段階を踏むと、モデル単価の議論より先に、作業設計の粗さが見えてきます。

体制面では、料金の監視担当を1人決めておく形が回りやすいところです。根拠は単純で、生成AIの請求は使い方の変化に敏感に反応するため、月次で誰も見ない状態が続くと、増えた原因を後から特定できなくなるためです。

自前でモデルを持つ選択肢を比較したい場合は、ローカルLLMを士業事務所で運用するに判断基準を整理しています。API料金と構築費用は性質が違うので、同じ土俵で比べる前に、何を守りたいのかを先に決めておくと選定が早く進みます。

モデル世代の入れ替わりを前提にした設計が要る

この分野で確かなのは、価格も型番も動くという一点です。前掲の公式価格表には、Gemini 3.5 Flash 以外にもGemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.1 Pro Preview など複数の世代が並んでおり、それぞれ価格帯が異なります。特定の型番を前提に業務フローを組むと、世代交代のたびに作り直しになります。

事務所側で採れる備えは2つあります。ひとつは、規程やマニュアルにモデル名を直接書かず、上位・標準・軽量という階層で書くこと。もうひとつは、プロンプトをモデル依存の書き方にしないことです。特定モデルの癖に合わせた指示は、乗り換え時にそのまま持ち越せません。

論点になるのは、社内ナレッジ側の設計です。モデルが変わっても、事務所が蓄積した資料と検索の仕組みは残ります。ここに投資したほうが、モデル選定に時間をかけるより長く効きます。仕組みの作り方は士業事務所のRAG構築で工程を追っています。

よくある質問

Gemini 3.5 Flash の料金はいくらですか

前掲の公式価格表によると、標準ティアの有料版で100万トークンあたり入力1.50ドル、思考トークンを含む出力9.00ドルです。バッチ処理とフレックス処理では入力0.75ドル、出力4.50ドルと示されています。実際の請求はトークン量に依存するため、単価だけでは総額を判断できません。

無料枠で顧問先の資料を扱ってよいですか

前掲の公式価格表には、製品改善への利用について無料ティアが「Yes」、有料ティアが「No」と記載されています。この記載を踏まえ、業務利用は事務所契約の有料アカウントに限る運用を採る事務所があります。守秘義務との関係は、士業ごとの根拠条文と照らして事務所として判断する形になります。

Flash と Flash-Lite はどう使い分けますか

判断を含むかどうかで分ける方法があります。前掲の価格表は Flash-Lite を高頻度の処理、翻訳、単純なデータ処理向けと説明しており、標準ティアで入力0.30ドル、出力2.50ドルと示しています。分類やタグ付けのような定型処理を Flash-Lite に落とし、下書き生成や読解を Flash に残す振り分けが扱いやすいところです。

出力トークンが高いのはなぜですか

思考トークンが出力に含まれるためです。前掲の価格表は、出力価格に思考トークンを含むと明記しています。推論の過程で生成されるトークンも課金対象となる建て付けなので、複雑な指示ほど出力側の消費が伸びます。

Google検索によるグラウンディングは無料ですか

月あたり5,000回の検索リクエストが無料で、これはGemini 3系の各モデルで共有されると前掲の価格表に記載されています。超過分は1,000リクエストあたり14ドルです。複数人で使う場合、無料枠の消費が早まる点は見込んでおいたほうがよいところです。

バッチ処理は士業事務所のどんな作業に向きますか

即時の応答が要らない一括処理に向きます。前掲の価格表がバッチの単価を標準の半分の水準で示しているため、夜間にまとめて回せる作業ほど効果が出ます。過去書面の分類、資料へのタグ付け、大量のメールの要約が候補になります。逆に、面談中の照会や、その場で顧問先に返す下書きには向きません。

コンテキストキャッシュはどんなときに使いますか

同じ長い資料に対して何度も質問する場面です。前掲の価格表は、キャッシュの単価に加えて1時間あたりの保管料が発生する建て付けを示しています。1回読ませて終わる使い方では保管料が乗るだけになるため、質問の回数と保持時間の見込みで判断する形になります。

事務所の規程にモデル名を書くべきでしょうか

階層で書く方法が採られています。上位・標準・軽量という区分にしておくと、世代交代のたびに規程を改訂せずに済みます。契約形態と投入可否の線引きを規程に置き、モデルの割り当ては運用マニュアル側に置く二層構成が扱いやすい形です。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。