士業事務所のRAG構築 過去の書面をAIで検索できる状態にする手順

士業事務所の過去の書面や手順書をAIで検索できるRAGの構築手順を解説。対象文書の選び方、5ステップの進め方、権限設計と守秘義務の論点を整理します。

士業事務所のRAG構築 過去の書面をAIで検索できる状態にする手順

RAGとは、手元の文書を検索して、その内容だけを根拠に回答させる仕組みのことです。

ベテランが辞めると、その人の頭の中にあった判断の蓄積が事務所から消える。士業事務所で長く続いてきた問題です。過去の書面と手控えを検索できる状態にしておけば、この損失を減らせます。この記事では、事務所内のナレッジをAIで引ける形にするRAGの構築手順と、社内データを扱ううえでの守秘義務の論点を整理します。本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で確認しています。生成AIの利用については個人情報保護委員会の注意喚起が判断の出発点になります。

汎用の生成AIと何が違うのか

先に仕組みの違いを押さえます。ここを理解しないまま導入すると、期待と結果がずれます。

汎用の生成AIは、学習した知識をもとに文章を作ります。事務所の過去の書面は学習していないため、聞いても答えられません。それらしい文章を作ることはできますが、事務所の実際の書面とは無関係の内容になります。

RAGは構造が違います。質問を受けたら、まず事務所の文書群から関係のありそうな箇所を検索し、その検索結果だけを材料にして回答を作ります。材料が手元の文書に限定されるため、事務所の実態に沿った答えが返ります。

この違いが実務で効くのは、根拠が示せる点です。回答の元になった文書がどれかを示せるため、担当者はその原文に当たって確認できます。汎用の生成AIの回答は、根拠を確かめる手段がありません。士業の実務では、この差が決定的になります。

一方で、限界もはっきりしています。手元の文書に書かれていないことは答えられません。過去に扱ったことのない論点について聞いても、有用な答えは返りません。また、検索の精度が悪ければ、関係のない箇所を材料にして的外れな回答が返ります。

したがって、RAGは事務所の蓄積を引き出す道具であって、知識を補う道具ではありません。この位置づけを所内で共有しておくと、導入後の評価が正しく行えます。汎用サービスの使い方は士業のChatGPT使い方入門で扱っています。

何を検索対象にするかを決める

構築の最初の作業は、対象の選定です。ここで全部を入れようとすると、確認する項目が膨らんで止まります。

第1の候補は、事務所が作った汎用の文例です。通知文の型、案内の文面、届出の添え状。顧問先の情報が入っていないため、扱いが軽くなります。最初の対象として最も向いています。

第2の候補は、業務の手順書です。どの順番で何を確認するか、どこに提出するか。担当者の頭の中にあるものを文書化してある事務所であれば、そのまま対象にできます。

第3の候補は、過去の書面です。実際に外に出した書面には、事務所の判断の蓄積が入っています。ただし顧問先の情報がそのまま含まれるため、扱いが重くなります。

第4の候補は、所内の手控えとメモです。判断に迷った経緯や、その事案で採った方針が書かれています。価値は高いのですが、最も慎重な扱いが要ります。

第5の候補は、外部の資料です。行政の公表資料や、事務所で購読している資料。公表されているものであれば扱いは軽くなりますが、著作権の扱いを確認します。

順番としては、第1と第2から始めるのが確実です。顧問先の情報を含まないため、仕組みの精度と使い勝手を確認する段階を、情報管理の議論と切り離して進められます。第3と第4は、仕組みが動くことを確認してから検討します。

対象を決めるときに、量を欲張らないことも大事です。文書が多いほど良い結果が出るわけではありません。古い様式や、すでに使っていない手順が混ざっていると、それを根拠にした回答が返ります。使われている文書だけに絞るほうが、精度が上がります。

構築の5ステップ

手順を具体的に書きます。

第1ステップは、文書の棚卸しです。どこに何があるかを一覧にします。共有フォルダ、担当者の端末、紙のファイル。散らばっている状態のままでは、検索対象にできません。この作業はAIと関係なく事務所の資産になります。

第2ステップは、形式の整理です。紙をスキャンした画像、表計算のファイル、ワープロのファイル、PDF。形式によって扱いやすさが変わります。文字として読み取れる状態になっているかが分かれ目で、画像のままのものは文字認識の工程が要ります。

第3ステップは、対象の絞り込みです。前章で決めた候補のうち、実際に入れるものを選びます。古い様式や使われていない手順は外します。ここで迷ったら入れない、という判断に倒しておくと、後で困りません。

第4ステップは、仕組みの選択です。事務所がすでに使っている環境の中に機能があるなら、そこから試します。Microsoft 365を基盤にしている事務所、Google Workspaceを使っている事務所では、既存のアカウント管理の枠内で動く選択肢が扱いやすくなります。専用のツールを別に契約する方法もありますが、管理する対象が増える点は考慮に入れます。

第5ステップは、試用と調整です。担当者が実際に業務で使う質問を投げて、返ってくる答えを確認します。ここで見るのは、根拠として示された文書が適切かどうかです。答えの文章が上手いかどうかではありません。的外れな文書を根拠にしている場合は、対象の絞り込みか、文書の整理に戻ります。

試用の段階で使う質問の型を挙げておきます。

以下の質問に、参照した社内文書の記載だけを根拠に回答してください。

条件:
- 参照した文書名と該当箇所を、回答の前に必ず示すこと
- 参照した文書に記載がない事項は「該当する記載が見つかりません」と答えること
- 一般的な知識で補わないこと
- 法的な評価や助言を書かないこと
- 複数の文書で記載が食い違う場合は、両方を併記して食い違いを指摘すること

質問:
"""
(ここに質問を書く)
"""

条件の中で最も効くのが、記載がない場合に見つからないと答えさせる一行です。これがないと、手元の文書にない内容を一般知識で埋めてしまい、RAGを使う意味がなくなります。

過去の書面から型を取り出す用途では、次のような質問の型が使えます。新しい案件に着手するとき、事務所が過去にどう書いてきたかを引く場面です。

以下の観点で、社内文書の中から該当する記載を集めてください。

観点:
- 同種の事案でこれまでに記載してきた項目
- その項目で使われている表現(原文のまま)
- 事案によって記載が分かれている項目

条件:
- 参照した文書名を各項目に添えること
- 一般的な知識で補わず、社内文書の記載だけを使うこと
- 法的な評価や助言を書かないこと
- 該当が見つからない観点は「該当なし」と出力すること
- 固有名詞は A社、甲、乙 に置き換えて出力すること

探したい事案の種類:
"""
(ここに書く)
"""

出力された結果は、そのまま使うのではなく、過去の書面のどれを開くかを決めるための索引として扱います。原文に当たる工程は残します。

守秘義務と権限設計 社内データ固有の論点

社内の文書を検索対象にすると、外部サービスへの入力とは別の論点が立ち上がります。

第1の論点は、事務所の外にデータを置くかどうかです。仕組みによって、文書を外部のサービスに預ける形になるものと、事務所内で完結するものがあります。預ける形を採るなら、扱いを公式ドキュメントで確認します。読む観点は、入力が学習に使われるか、保持期間はどれくらいか、処理はどの地域で行われるか、管理者が利用状況を把握できるかの4点です。Anthropicはプライバシーポリシーを、GoogleはVertex AIのドキュメントを、MicrosoftはMicrosoft 365 Copilotのプライバシーを公開しています。

第2の論点は、事務所内部の権限です。これがRAG固有の難しさになります。従来、担当者は自分が関与した案件の情報にしか触れませんでした。検索できる状態にすると、担当していない案件の情報にも手が届きます。誰がどの範囲の文書を引けるかを設計する作業が要ります。

権限の設計は、対象の絞り込みと連動します。汎用の文例と手順書だけを対象にするなら、全員が引ける形で運用している事務所が大半です。過去の書面や手控えを入れるなら、案件ごとの担当や役職で範囲を分けることを検討します。仕組みの側にその機能があるかどうかも、選定の条件に入ります。

権限を分ける設計には、運用の手間が伴います。案件ごとに設定するのか、部門やチームの単位で分けるのか。細かくするほど管理が重くなり、粗くするほど範囲が広がります。事務所の規模と扱う案件の性質に応じて、どこで折り合いをつけるかを決めます。少人数の事務所では、そもそも全員が全案件を知っている場合もあり、その場合は権限の分割より、外部に出ない仕組みを選ぶことのほうが効きます。

第3の論点は、守秘義務との関係です。士業の守秘義務は、それぞれの資格法に規定が置かれています。弁護士は弁護士法第23条、税理士は税理士法第38条、公認会計士は公認会計士法第27条、司法書士は司法書士法第24条、行政書士は行政書士法第12条、社会保険労務士は社会保険労務士法第21条、弁理士は弁理士法第30条です。個人情報の側では、安全管理措置が個人情報の保護に関する法律の個人情報保護法第23条に置かれています。

これらの条文は、事務所内部での情報の共有範囲について一律の答えを示すものではありません。ただ、義務の重さを踏まえれば、誰でも全案件を引ける状態にすることには慎重な検討が要る、という判断に傾く事務所が多くなります。規程への落とし方は士業事務所のAI利用規程テンプレートで扱っています。

第4の論点は、退職時の扱いです。検索できる状態は、持ち出しやすい状態でもあります。アカウントの停止を入退職の手続きに組み込むことは、他のサービスと同じく必要になります。

精度が出ない場面と、その対処

構築しても期待どおりに動かない場面には型があります。

1つ目は、文書の量が多すぎる場合です。使っていない古い様式や、重複した文書が混ざっていると、それらを根拠にした回答が返ります。対処は対象の絞り込みで、現に使っている文書だけに減らします。

2つ目は、文書の中身が構造化されていない場合です。長い文書の中に複数の論点が混ざっていると、検索が的を外します。対処は、文書を論点ごとに分けることですが、既存の文書を作り直す手間が発生します。無理に整理せず、検索の結果を人が確認する前提で使うほうが現実的な場面もあります。

3つ目は、画像のままの文書が入っている場合です。スキャンした紙は、文字として読み取れなければ検索の対象になりません。文字認識の工程を挟むか、その文書は対象から外します。

4つ目は、質問の仕方が曖昧な場合です。担当者が漠然と聞くと、検索も漠然とした結果を返します。事務所で使う質問の型を共有しておくと、精度が安定します。

5つ目は、回答の根拠を確認していない場合です。返ってきた文章だけを読んで満足すると、的外れな文書を根拠にしていても気づきません。根拠として示された文書を開いて確認する工程を、使い方の中に組み込みます。

いずれの場面でも、共通する対処は同じです。RAGの回答を正解として扱わず、根拠の文書に当たる工程を残すことです。この工程を省くと、事務所の蓄積を引き出す道具が、それらしい文章を作る道具に変わります。

費用と体制、導入の順番

費用は、仕組みの選び方で大きく変わります。既存の環境の機能を使う場合はライセンス料の範囲に収まることがあり、専用のツールを契約する場合は別途の費用が発生します。金額は事業者と契約形態で変わるため、各社の料金ページで確認します。

工数は、文書の棚卸しと整理に集中します。参考値として、対象の選定と形式の確認に数日、試用と調整にさらに数日を見ておくと、無理のない立ち上げになります。文書が散らばっている事務所では、棚卸しだけでこれ以上かかる場合もあります。

体制では、文書の管理を持つ人を決めます。検索対象に何を入れるか、古い文書をいつ外すかを判断する担当です。この担当がいないと、対象が増える一方になり、精度が落ちていきます。

導入の順番としては、汎用の文例と手順書から始め、仕組みが動くことを確認してから、顧問先の情報を含む文書の検討に進みます。この順番なら、情報管理の議論と技術の検証を切り離せます。導入全体の進め方は士業事務所のAI導入の進め方にまとめています。

補助金の活用を検討する場合は、IT導入補助金の公式サイトで対象ツールと申請要件を確認します。登録されたITツールが対象になるため、使いたいツールが登録されているかを先に調べます。

これから変わること

事務所の文書を扱う機能は、業務システムの側にも組み込まれていく方向にあります。会計や労務のシステムが、そのシステム内のデータを検索して答える機能を持てば、事務所が別に仕組みを用意する必要が薄れる領域も出てきます。

一方で、システムをまたいだ検索は残ります。書面はワープロのファイル、記録は業務システム、メールは別、という状態が士業事務所では一般的です。この分散を横断できるかどうかが、道具を選ぶときの見どころになります。

制度面では、個人情報保護法の見直しの議論が続いています。委員会の公表資料は個人情報保護委員会の報道発表で追えます。事務所内部での情報の扱いに関する考え方が示されれば、権限設計も見直しの対象になります。

見落とされがちですが、RAGの導入は文書管理そのものを見直す機会でもあります。何がどこにあるかを一覧にする作業は、AIを使うかどうかにかかわらず事務所の資産になります。仕組みを入れずに棚卸しだけを行っても、担当者の探す時間は減ります。

よくある質問

RAGと汎用の生成AIは何が違いますか

材料が違います。汎用の生成AIは学習した知識をもとに文章を作り、RAGは手元の文書を検索してその内容だけを材料に回答します。RAGは回答の根拠になった文書を示せるため、担当者が原文に当たって確認できます。

どの文書から検索対象にすればよいですか

事務所が作った汎用の文例と、業務の手順書から始める例が多く見られます。顧問先の情報を含まないため、仕組みの精度と使い勝手の確認を、情報管理の議論と切り離して進められます。過去の書面や手控えは、仕組みが動くことを確認してから検討します。

文書は多いほうがよいのですか

そうとは限りません。使っていない古い様式や重複した文書が混ざっていると、それを根拠にした回答が返ります。現に使っている文書だけに絞るほうが、精度が上がります。

誰でも全案件を検索できる状態にしてよいですか

慎重な検討が要る論点です。従来、担当者は自分が関与した案件の情報にしか触れませんでした。検索できる状態にすると範囲が変わるため、案件ごとの担当や役職で範囲を分けることを検討する事務所が多く見られます。

回答をそのまま使ってよいですか

根拠として示された文書を開いて確認する工程を残します。的外れな文書を根拠にしていても、返ってきた文章だけを読んでいると気づきません。この工程を省くと、事務所の蓄積を引き出す道具ではなくなります。

スキャンした紙の書類も対象にできますか

文字として読み取れる状態になっていることが前提になります。画像のままでは検索の対象になりません。文字認識の工程を挟むか、その文書は対象から外す判断になります。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。