RAGの精度が上がらない時は何から直すか。症状から原因を引き、質問・文書・検索の設定・モデルの順に直す

RAGの精度とは、社内文書を読み込ませたAIが、質問に合った文書を探し出せるか(検索の精度)と、その中身どおりに答えられるか(回答の精度)の度合いのことです。回答がずれたときは、AIのモデルを替える前に、質問の書き方、文書の整理、検索の設定の順に、手間と費用がかからず自分で直せるところから直していくのが近道となります。旧版の規程が残っている、3列以上の表を読み取れていない、対象の文書を広げすぎている、といった文書の側に原因があることも少なくありません。

RAGを社内に用意する手順や費用、自前で作るか既製サービスを使うかの判断は、RAG構築の方法と費用にまとめています。仕組みそのものから知りたい方はRAGとはをご覧ください。

RAGの精度とは|検索のずれと回答のずれに分けて考える

RAGの精度は、検索の精度と回答の精度の2つに分けて見ると、直す場所がはっきりします。RAGは、質問を受けるとまず社内文書の中から関係しそうな断片を探し、見つかった断片をAIに渡して回答を書かせる仕組みになります。前半の探す工程で外れると、AIは見当違いの資料をもとに答えることになってしまいます。後半の書く工程で外れると、正しい資料を渡されていても、資料にないことを書き足したり、数字を読み違えたりします。

デジタル庁の「テキスト生成AI利活用におけるリスクへの対策ガイドブック」(2025年6月6日更新・α版)も、評価の観点をこの2段に分けています。1つ目は、質問に対して想定した文書をきちんと抜き出せているか、関係のない文書が混ざっていないかという点です。2つ目は、回答に出てくる固有名詞や内容が、抜き出した文書の中に本当に書かれているかという点になります。回答がおかしいと感じたら、出典が表示されるサービスなら、まず回答の出典を開き、正しい文書を引けていたかどうかを確かめてみてください。出典が違えば検索のずれ、出典は合っているのに答えが違えば回答のずれと考えることが出来ます。

見分け方:出典の文書が違っていれば検索のずれで、文書の整理や検索の設定が直す対象になります。出典が正しいのに答えが違えば回答のずれで、指示文や生成モデルの側を見直します。

どちらのずれでも、原因が文書の側にある場合は少なくありません。IPAのサイトに掲載された「テキスト生成AIの導入・運用ガイドライン」は、回答の精度を下げる情報の例として、ノイズを含む情報、重複した情報、最新版ではない古い情報を挙げています。AIそのものより、読み込ませた文書の状態が答えの良し悪しを左右する場面も多いと考えておくとよいでしょう。

※このガイドラインは、IPAの中核人材育成プログラムの卒業プロジェクトメンバーの見解をまとめたもので、IPAの意見を代表するものではないと掲載ページに明記されています(2024年7月31日公開)。各社・各団体の公開ページの内容は、2026年9月18日〜10月4日に確認したものです。

症状から原因を引く|回答がずれる5つのパターン

回答のずれ方には、原因ごとにある程度決まった形があります。よく見かける5つの症状について、考えられる原因と、確かめ方、担当者が手を動かして直す内容を並べました。

症状1:改定前の古い規程で答える

規程を改定したのに、AIが改定前の内容を答えるときは、旧版のファイルが読み込ませた文書の中に残っていることを疑いましょう。新旧の両方が入っていると、検索はどちらの版も同じように拾ってきます。AIには版の新しさを見分ける材料がないため、古い版の断片をもとに答えてしまうことがあります。

  • 考えられる原因:旧版・下書き・コピーのファイルが残っている
  • 確かめ方:回答の出典に出たファイル名と改定日を見る
  • 直し方:旧版を外し、1つの規程は最新版の1ファイルだけにする

症状2:表の数字を取り違える

料金表や手当の一覧で、行と列を取り違えた数字を答えるときは、表の読み取りを疑います。Difyに規程集を読み込ませて100件の質問を試したアスピック編集部の検証(LLMはChatGPT-4o、リランクにCohereのモデルを使った環境)では、全体の正答率は約70%でした。文章や2列の簡単な表に書かれた内容は70%以上だった一方で、3列以上の表では正答率が30%以下だったと報告されています。

  • 考えられる原因:3列以上の表やセルの結合、スキャンしたPDFが、検索用の文字に直す段階で崩れている
  • 確かめ方:検索結果を試す画面で、該当の断片が表として読める形になっているかを見る
  • 直し方:表を1行1文の文章に書き換えた版を作る(手順2に例があります)

症状3:関係のない文書を引いてくる

経費の質問に営業資料が出典として出てくるなど、関係のない文書を引くときは、読み込ませる範囲が広すぎる可能性があります。DeNAは社内AIヘルプデスクの改善を紹介した同社のブログで、AIが参照する対象のスペースを減らしたことで、回答が大きく改善したケースがあったと公表しています。文書は多いほど良いわけではなく、その窓口で答えるべき文書に絞るほうが当たりやすくなります。

  • 考えられる原因:部署や用途の違う文書を、1つの置き場所にまとめて入れている
  • 確かめ方:10問ほど質問し、出典に出てくる文書の種類を並べて見る
  • 直し方:用途ごとに置き場所を分け、その窓口に関係する文書だけを入れる

症状4:資料にあるのに「見つかりません」と答える

文書に書いてあるはずなのに、AIが資料に見つからないと答えるときは、検索の設定を疑ってみましょう。考えられる原因として、検索の方式がベクトル検索だけになっている、取り出す断片の数が少ない、類似度のしきい値が高すぎる、の3つが挙げられます。Difyの公式ドキュメントでは、取り出す断片の数(TopK)の既定値は3とされ、しきい値(Score Threshold)を上げるほど取り出される断片が少なくなると説明されています。

  • 考えられる原因:検索の方式・取り出す数・しきい値の設定が、文書に合っていない
  • 確かめ方:検索結果を試す画面に同じ質問を入れ、目当ての断片が取り出されているかを見る
  • 直し方:ハイブリッド検索に切り替える、取り出す数を少し増やす、しきい値を下げる(手順3)

症状5:言い換えると答えられる

「有給」では答えられず、「年次有給休暇」と聞き直すと答えられるような場合は、表記ゆれが原因と考えられます。社内の略語や製品の型番は、意味の近さで探すベクトル検索では拾いにくいことがあります。Microsoftも、製品コードや専門用語、日付、人の名前を探す場面では、完全一致を見つけられるキーワード検索のほうがよく働くと説明しています。

  • 考えられる原因:文書と質問で呼び方が違う(略語・旧名称・全角と半角)
  • 確かめ方:同じ質問を、呼び方だけ変えて3通り試す
  • 直し方:文書の中で正式名称と略称を並べて書く、キーワード検索を併用する

5つの症状のうち、旧版・表・範囲・表記ゆれの4つは、文書の持ち方を直すことで解消に向かいます。設定を触る前に、まず出典に出てきた文書を開いて中身を確かめる習慣を付けてみてください。

直す順番は担当者が自分で直せる順|質問→文書→検索の設定→モデル

直す順番は、手間と費用がかからず担当者が自分で直せるところから、質問の書き方、文書の整理、検索の設定、生成モデルの順に進めるのが無理のない形です。NTT西日本のエンジニアブログは、RAGの精度を上げる7つの方法を、作業の手間(稼動コスト)と有効度で整理しています。同社の見立てでは、生成AIモデルの変更は手間が高く、システムプロンプトの変更や検索方法の変更は、手間が低いのに有効度が高い方法となります。

  1. 生成AIモデルの変更:手間 高・有効度 高
  2. 登録するファイルの加工(文書の構造化、不要な情報の削除):手間 高・有効度 高
  3. チャンク分割方法の変更:手間 中・有効度 中〜高
  4. 検索方法の変更(キーワード検索・ベクトル検索・ハイブリッド検索):手間 低・有効度 高
  5. システムプロンプトの変更:手間 低・有効度 高
  6. 生成AIのパラメータの変更(Temperatureの調整):手間 低・有効度 中
  7. 質問内容の変更(質問を具体的にする):手間 低・有効度 中

ファイルの加工は手間も有効度も高く、表や図を含む場合に非常に有効だと同社は説明しています。ただし評価は同社の見立てで、効果の数値は示されていません。この評価に、総務や情シスの担当者が自分の手で触れるかどうかを重ねると、次の4段になります。

  1. 質問の書き方と指示文(システムプロンプト)を直す:管理画面と社内への案内で、担当者が自分で直せる
  2. 社内文書を整える:文書の持ち主の協力を得て、担当者が進められる
  3. 検索の設定を見直す:画面で触れる項目は自分で、触れない項目は提供元に確かめる
  4. 生成モデルを替える:費用が変わるため、上の3つで足りないときに検討する

順番を守る理由:モデルを先に替えると、費用が上がるうえ、旧版や表の崩れといった原因は残ったままとなってしまいます。直すたびに同じ質問セットで測り直せば、どの手が効いたのかを確かめることが出来ます。

手順1:質問の書き方と指示文を直す

最初に手を付けたいのは、AIへの指示文と、社員の質問の書き方になります。どちらも管理画面や社内への案内で直せるため、費用をかけずに今日から試すことが出来ます。

資料にないことをもっともらしく答える(ハルシネーション)を抑える指示文

RAGでも、渡された資料に答えがないとき、AIがもっともらしい答えを作ってしまうこと(ハルシネーション)があります。これを抑えるには、資料に書いていないことは答えない、出典を必ず添える、という決まりを指示文に書いておくのが手軽な方法となります。次のひな形は、社内規程の問い合わせ窓口を想定した文面です。

あなたは社内規程の問い合わせに答える担当です。次のルールを必ず守ってください。
1. 回答は、渡された社内資料に書かれている内容だけをもとに作る
2. 資料に答えが見つからないときは、推測で補わず「資料には記載が見つかりませんでした。総務部にお問い合わせください」と答える
3. 回答の最後に、根拠にした文書名とページ(または見出し)を書く
4. 同じ内容を書いた文書が複数あるときは、改定日が新しい文書を使う。古い文書と食い違う場合は、その旨を書き添える
5. 表から数字を答えるときは、どの行とどの列の値かを書く
6. 金額・日数・期限は、資料の表記をそのまま書き写す

4番目のルールは、旧版が残っているかもしれない段階での保険になります。ただし、指示文だけで旧版の問題は消えないため、文書の整理(手順2)とあわせて進めましょう。

社員の質問の書き方を整える

NTT西日本の整理では、質問内容を具体的にすることも、手間が低い方法として挙げられています。「休みについて教えて」より「入社2年目の年次有給休暇は何日ですか」と聞くほうが、検索が目当ての断片に届きやすくなります。社内に配るときは、聞き方の良い例と悪い例を3つずつ添えた案内を用意しておくとよいでしょう。

回答のばらつきが気になるならTemperatureを下げる

同じ質問への答えが毎回ぶれる場合は、生成AIのパラメータの1つであるTemperature(回答のばらつき具合)を下げる方法もあります。NTT西日本の評価では手間が低く有効度は中程度とされており、画面で変えられるサービスなら試してみる価値があるでしょう。

ここで挙げた指示文は、社員が使うAIの環境に管理者が設定して初めて、全員の質問に効くものになります。社員がそれぞれ個人のアカウントで規程を読み込ませている状態では、指示文も文書の版も、会社としてそろえようがなくなってしまいます。

指示文と文書をそろえるなら、AIを使う場所も会社で1つに

社員が個人のAIに規程を入れると、指示文も文書の版も会社でそろえられません。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。

手順2:社内文書を整える(データの前処理)

文書の整理は手間がかかる一方で、効き目がはっきり出やすい手順になります。DeNAは同社のブログで、良い書き方の見本となるナレッジのテンプレートを作り、それに沿ってPC関連のナレッジを書き直したところ、該当する問い合わせへの回答が改善したと紹介しています。文書を読み込ませる前に、次の項目を1つずつ確かめてみてください。

社内文書の整え方チェックリスト

  • 旧版・下書き・コピーを外し、1つの規程は最新版の1ファイルにしたファイル名に「最新」「確定」と付いた複数の版が並ぶ状態をなくします。旧版を残す必要があれば、AIに読み込ませない別の場所へ移します。
  • 同じ内容を書いた文書の重複をなくした規程の本文とQ&A集で同じことを違う表現で書いていると、片方だけ改定したときに食い違いが生まれます。
  • ファイル名に文書名と改定日を入れた例:旅費規程_2026年4月改定.pdf。出典に出たとき、版がひと目で分かります。
  • 本文の冒頭に、施行日・改定日・対象者を書いた断片だけが取り出されても、いつの、誰向けの決まりかが伝わるようにします。
  • 1つのファイルには1つのテーマだけを書いた総務の手引きを1冊にまとめたPDFは、章ごとに分けると関係のない章を拾いにくくなります。
  • 見出しを付け、1つの段落には1つの話を書いた文書は検索のために細かく区切られます。見出しのない長文は、区切りの位置で話が途切れやすくなります。
  • 3列以上の表を、1行1文の文章に書き換えた版を用意した書き方は下の例を参考にしてください。
  • スキャンしたPDFを、文字として読める形に直した画像のままのPDFは、文字として読み取れていないことがあります。
  • 略語・旧名称には正式名称を並べて書いた有給(年次有給休暇)のように、社内で使われる呼び方を本文に並べておきます。
  • 機密情報・個人情報を含む文書は外すか、見てよい人を分けたIPAのサイトに掲載されたガイドラインも、RAGに使うデータへのアクセス制限と、定期的な棚卸を挙げています。
  • 文書ごとに持ち主(更新の担当者)を決めた改定のたびに差し替える人が決まっていないと、旧版がまた残ります。

このうち、旧版の削除と表の書き換えは、症状1と症状2に直接効く項目です。

3列以上の表とスキャンPDFを1行1文の文章に直す

3列以上の表は、行と列の組み合わせを1文ずつの文章に書き換えると、検索でも回答でも取り違えが起きにくくなります。次の例は、出張の日当を定めた架空の表を書き換えた場合の形です。

【書き換える前(3列以上の表)】
区分|国内出張|海外出張
部長以上|3,000円|6,000円
課長|2,500円|5,000円
一般社員|2,000円|4,000円

【書き換えた後(1行1文)】
・部長以上の国内出張の日当は、1日3,000円です。
・部長以上の海外出張の日当は、1日6,000円です。
・課長の国内出張の日当は、1日2,500円です。
・課長の海外出張の日当は、1日5,000円です。
・一般社員の国内出張の日当は、1日2,000円です。
・一般社員の海外出張の日当は、1日4,000円です。
(金額は説明のための架空の例です)

元の表は人が読む版として残し、書き換えた文章の版をAIに読み込ませる版として扱いましょう。スキャンしたPDFも同じで、文字として読み取れる形に直してから入れると、症状2のような取り違えを減らすことが出来ます。

ファイル名・日付・見出し(メタデータ)を付ける

メタデータとは、文書の名前や改定日、対象部署など、文書そのものについての情報のことです。Claudeのプロジェクト機能のヘルプも、内容が分かるファイル名を付けることを、RAGを使うときの勧めとして挙げています。出典にはファイル名が表示されることが多いため、名前に文書名と改定日が入っていれば、社員も担当者も版の違いにすぐ気づけるでしょう。

手順3:検索の設定を見直す|Difyの画面で触れる項目

文書を整えても外れるときは、検索の設定に手を入れます。ノーコードでRAGを作れるDifyを例にすると、公式ドキュメントに出てくる設定名は次のようになります。名前は違っても、他のサービスにも似た項目があることが多く、画面にない項目は提供元に問い合わせて確かめましょう。

※Difyの設定名は、公式ドキュメント(英語版)の表記です。日本語の画面での表記は確認していません。

Retrieval Testingで検索だけを試す

Difyでは、ナレッジ(読み込ませた文書の置き場所)の左側のメニューにあるRetrieval Testingのアイコンから、検索を試す画面に入れます。Recordsの欄には、この画面で試した質問に加えて、連携したアプリから実際に行われた検索の記録も残ります。社員から外れた回答の報告があったら、同じ質問をここに入れて、目当ての断片が取り出されているかを先に見てみてください。

ハイブリッド検索:キーワード検索とベクトル検索を両方使う

Difyの検索方式には、Vector Search(意味の近さで探すベクトル検索)、Full-Text Search(語句で探すキーワード検索)、両方を同時に走らせるHybrid Searchの3つがあります。MicrosoftもAzure AI Searchの説明で、ハイブリッド検索は2つの検索を並列に走らせ、RRF(逆ランクフュージョン)という方法で1つの結果にまとめると説明しています。同社は、自社のベンチマークでセマンティックランカーを使ったハイブリッド検索に関連性の大きな利点が示されたと書いていますが、数値は同じページに載っていません。型番や略語での質問が多い窓口なら、まずハイブリッド検索に切り替えることを検討しましょう。

TopKとScore Threshold:取り出す数としきい値

TopKは、質問に近いと判断された断片をいくつ取り出すかを決める設定で、既定値は3、数を増やすほど多くの断片を拾うとされています。Score Thresholdは、取り出す断片に求める類似度の下限で、値を高くするほど似ている断片しか取り出されず、数が減ります。IPAのサイトに掲載されたガイドラインにも、AIに渡るのは上位数件のデータの内容のみ、という趣旨の記載があります。症状4のように見つからないと言われる場合は、TopKを少し増やすか、しきい値を下げてから、Retrieval Testingで結果を見比べましょう。反対に、関係のない断片が混ざる場合は、しきい値を上げる方向で試すことになります。

リランキング(Rerank Model)で並べ替える

リランキングとは、検索で取り出した断片を、別のモデルで質問との関係の深さ順に並べ直すことです。Difyでは、Rerank Modelは既定では無効で、有効にすると外部のRerankモデルが検索結果を並べ替える仕組みとなっています。Rerankモデルの利用料は、それぞれのモデルの料金ページで確かめる必要があります。Anthropicの自社評価では、各断片に文書全体の文脈を短く書き足してから索引にする方法(Contextual Retrieval)に、キーワード検索とリランキングを組み合わせると、上位20件で目当ての断片を取りこぼす割合が5.7%から1.9%に下がったと発表されています。同じ評価で、文脈の書き足しだけの場合は5.7%から3.7%、キーワード検索を加えた場合は2.9%まで下がりました。

チャンク(文書の区切り)の大きさと区切り方

チャンクとは、検索しやすいように文書を区切った1つひとつの断片のことです。Difyでは、区切り方のモードとしてGeneralとParent-childの2つがあり、Parent-childは小さな子の断片と大きな親の断片の2段に分けて扱います。Maximum chunk length(1つの断片の最大文字数)やChunk overlap(隣り合う断片で重ねる文字数)、区切りの記号は、あとからでも変えられます。一方で、モードそのものはナレッジを作ったあとでは変えられないため、作る前に決めておく必要があるでしょう。手順書のように前後のつながりが大事な文書は、断片が小さすぎると途中で意味が切れてしまいます。

埋め込みモデルとインデックス方式は作る前に決める

埋め込みモデルとは、文章を数値の並びに変えて、意味の近さで探せるようにする部品のことです。Difyでは、インデックスの方式にHigh QualityとEconomicalの2つがあり、High Qualityで作ったナレッジはあとからEconomicalに切り替えられないとされています。インデックスの方式や埋め込みモデルは、あとから変えると作り直しの手間が大きいため、最初に決めておき、精度の見直しでは最後に回すとよいでしょう。

自分で触れる項目と、提供元に確かめる項目

法人向けのAIチャットに付いている社内文書の機能では、ここに挙げた設定の多くが画面に出てこないこともあります。担当者が自分で直せるのは文書と指示文までと考え、検索の方式や取り出す数、リランキングを変えられるかどうかは、提供元に確かめてみてください。問い合わせるときは、次のように聞くと話が早く進みます。

社内文書の検索について、次の4点を教えてください。
1. キーワード検索とベクトル検索を併用していますか
2. 1回の質問で取り出す断片の数と、しきい値は変えられますか
3. 検索結果の並べ替え(リランキング)は使われていますか
4. 回答にどの文書のどの部分を使ったかを、画面で確かめられますか

手順4:生成モデルの変更は最後に検討する

生成モデルの変更は、上の3つの手順を試しても回答のずれが残るときに検討する手になります。NTT西日本の整理では、有効度は高いものの、稼動コストも高い方法とされています。検索で正しい断片を取り出せていない状態でモデルだけを替えても、渡される資料が外れている限り、回答は良くなりにくいでしょう。モデルを替える価値があるのは、出典が正しいのに読み違える、長い規程の前後関係を取り違える、といった回答のずれが評価で多く出た場合です。

1つのAIに決め打ちせず、同じ質問を別のAIにも答えさせて比べられる環境があると、モデルの違いによるずれかどうかを確かめやすくなります。どのAIがどの用途に向くかは、主要4AIの違いと使い分けにまとめています。

評価用の質問と正解を用意する|質問セットのひな形

精度を上げる作業は、毎回同じ質問セットで測り直せるようにしてから始めると迷いません。測る物差しがないと、文書を直した効果も、設定を変えた効果も、感覚でしか語れなくなってしまいます。

事例:DeNAは直近1か月の問い合わせから約100件を作った

DeNAは、社内AIヘルプデスクの改善を紹介したブログ(2025年10月30日)で、直近1か月の問い合わせからIT領域の操作の質問を選び、カテゴリをすべて網羅するように約100件のテストケースを作ったとのことです。同社は、50%前後だったAIの正答率が、2025年10月時点で80%に達したと公表しています。判定の基準や採点の方法は確かめられていないため、数字は同社の自己申告として読む必要があります。社員10〜200名の会社なら、目安として窓口ごとに30件ほどから始めても、改善の前後を比べる手がかりになるでしょう。

質問セットのひな形(質問・正解・出典・合否)

質問セットは、表計算ソフトに質問・正解・出典・合否の4つの列を作るだけで足ります。次の例のように、正解には資料に書かれた答えを、出典には文書名とページを書いておきましょう。

質問|正解|出典(文書名とページ)|合否
ノートPCを社外に持ち出すときの申請先は?|所属長の承認を得て情報システム担当へ申請|IT機器管理規程 p.4|○
課長の海外出張の日当はいくら?|1日5,000円|旅費規程 p.2(日当の表)|×(回答)
有給の申請は何日前まで?|休む日の3営業日前まで|就業規則 休暇の章 p.12|×(検索)
社員旅行の積立金はいくら?|資料に記載なし(分からないと答えれば正解)|該当なし|○
(いずれも説明のための架空の例です)

合否には○か×だけでなく、×のときに検索と回答のどちらでずれたかを書き添えると、直す場所がすぐ分かります。デジタル庁のガイドブックの2段の観点に沿って、出典が違えば×(検索)、出典が合っていて答えが違えば×(回答)と書き分けるのが簡単です。

問い合わせ履歴から30件を選ぶ手順

30件は、次の順で選ぶと偏りを抑えられます。

  1. 直近1〜3か月の問い合わせ(メール・チャット・窓口の記録)を書き出す
  2. 内容ごとに分類し、件数の多い分類から順に、すべての分類が入るように選ぶ
  3. 表の数字を聞く質問と、改定があった規程の質問を必ず数件入れる
  4. 資料に答えがない質問を3〜5件入れ、分からないと答えられるかを見る
  5. 同じ内容を呼び方だけ変えて聞く質問を数件入れる
  6. 正解と出典は、文書の持ち主に確かめてもらう

直すたびに同じ質問で測り直す(改善の回し方)

質問セットは一度作ったら、文書や設定を1つ直すたびに全件を回し、○の数を記録していきましょう。一度に複数の箇所を直すと、どれが効いたのか分からなくなってしまいます。新しい規程が加わったり、社員から外れた回答の報告が届いたりしたら、その質問をセットに足していくことで、測る範囲が実際の使われ方に近づいていきます。

Ragasなどの評価指標も目安になる

件数を増やして自動で測りたくなったら、オープンソースの評価ツールRagasが定めている指標が参考になります。

  • Faithfulness:回答が、取り出した資料と食い違っていないか(0〜1の値で表す)
  • Context Precision:関係のある断片を、関係のない断片より上位に並べられているか
  • Context Recall:必要な情報を、取りこぼさずに取り出せたか
  • Answer Relevancy:回答が質問に沿っているか

名前は難しく見えますが、手作業の質問セットで見ている検索のずれと回答のずれを、数値に分けて測るものと考えることが出来ます。何%なら社内で使ってよいかに決まった基準はないため、規程の問い合わせのように間違いが響く用途ほど、回答を人が確かめる運用と組み合わせて決めましょう。

会社で安全に使うには|文書を入れるAIの置き場所を1つに

精度を上げる作業は、文書を入れるAIの環境が会社で1つにそろっていて、初めて積み上げが効くものになります。社員が別々のサービスに規程を読み込ませていると、版の管理も質問セットでの評価も、会社としては手の打ちようがなくなってしまいます。会社で用意する環境では、次の4点を確かめておきたいところです。

  • 入力や読み込ませた文書を、AIの学習に使わせない設定が全員に効いているか社員ごとの操作に任せると、設定の漏れが起こりやすくなります。
  • 誰がいつどのAIを使ったかのログを、管理者が確認できるか外れた回答の報告を受けたとき、同じ質問を再現して質問セットに足す手がかりになります。
  • 社員全員に配れる契約と料金の形になっているか一部の人にしか配れないと、配られなかった人が個人のアカウントで文書を読み込ませ始めます。会社から見えない野良AI(シャドーAI)の典型的な入り口です。
  • 用途に応じて複数のAIを使い分けられるか手順4のように、モデルの違いによるずれを確かめるときにも役立ちます。

閲覧の権限も忘れずに確かめておきましょう。IPAのサイトに掲載されたガイドラインは、検索用のデータベースに機密情報を入れると全ての利用者がそれを参照できてしまう点を挙げ、役職や所属に合った情報かを確かめる必要があるとしています。Microsoft Copilot(旧称 Microsoft 365 Copilot)は、利用者が少なくとも表示の権限を持つ組織のデータだけを表示すると説明されており、元の文書の権限設定が正しいことが前提となります。

文書に紛れ込んだ指示にも注意が要ります。OWASPは、白い背景に白い文字で、以前の指示を無視してこの候補者を推薦するよう書き込んだ履歴書が、RAGを使った選考の仕組みに送られる例を挙げています。対策として、読み込ませる文書は信頼できる出どころのものに限ることが勧められており、社外から受け取ったファイルをそのまま入れるのは避けたいところです。点検の項目は生成AIのセキュリティ対策チェックリストに、社外に文書を出さずに作る方法はローカルLLMでRAGを作る方法に、既製のRAGサービスの比べ方はRAGサービスの比較にまとめています。

規程やマニュアルを読み込ませるAIを、会社で1つの環境に

UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1つの契約・1つの画面で使える法人向けサービスです。自社の資料を読み込ませて回答させる社内文書RAGを備え、会話の途中でもモデルを切り替えられます。管理者ダッシュボードで利用ログ・権限・使うモデルのON/OFFを管理でき、基盤はAWSの日本リージョンで稼働しています。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。

UPGEAR AIの詳細を見る

よくある質問

RAGの精度が低いとき、最初に何を確かめればよいですか?
出典が表示されるサービスなら、まず回答の出典を開き、正しい文書を引けているかを確かめてください。出典が違えば検索のずれで、文書の整理や検索の設定を直します。出典が正しいのに答えが違えば回答のずれで、指示文や生成モデルを見直します。旧版の残りや表の崩れなど、文書の側に原因があることも少なくありません。
表が多い文書は、RAGに向いていませんか?
向いていないわけではありませんが、3列以上の表はそのままだと取り違えが起きやすくなります。アスピック編集部の検証環境(LLMはChatGPT-4o、リランクにCohereのモデル)では、3列以上の表に書かれた内容の正答率は30%以下だったと報告されています。行と列の組み合わせを1行1文の文章に書き換えた版を読み込ませると、取り違えを減らすことが出来ます。
評価用の質問は何件くらい用意すればよいですか?
決まった件数はありません。DeNAは直近1か月の問い合わせから約100件のテストケースを作ったと公表しています。社員10〜200名の会社なら、目安として窓口ごとに30件ほどから始め、外れた回答の報告が届くたびに質問を足していく形でも、改善の前後を比べる手がかりになります。
モデルを新しいものに替えれば、精度は上がりますか?
上がる場合もありますが、検索で正しい文書を取り出せていなければ、回答は良くなりにくくなります。NTT西日本の整理でも、モデルの変更は手間の高い方法とされています。質問の書き方、文書の整理、検索の設定を試してから検討するのが無理のない順番です。
既製のAIサービスでも、検索の設定は変えられますか?
サービスによって異なります。Difyのようなノーコードの基盤では、検索の方式やTopK、Score Threshold、Rerank Modelなどを画面で変えられます。法人向けのAIチャットに付いている社内文書の機能では画面に出てこない項目もあるため、変えられるかどうかは提供元に確かめてください。

まとめ

RAGの精度は、検索のずれと回答のずれに分けて見ると、直す場所が見えてきます。回答がずれたら、出典が表示されるサービスなら出典を開き、旧版・3列以上の表・広すぎる範囲・検索の設定・表記ゆれのどれに当たるかを、症状から引いてみてください。直す順番は、質問の書き方と指示文、文書の整理、検索の設定、生成モデルの順で、手間と費用がかからず自分で直せるところから進めるのが無理のない形となります。どの手を打つときも、問い合わせ履歴から選んだ目安30件ほどの質問セットで前後を測れば、効いたかどうかの手がかりを数でつかめます。文書を入れるAIの置き場所を会社で1つにそろえることが、版の管理と評価を続けるための土台になります。

法人でのAI活用の記事は、AI活用コラム一覧からご覧いただけます。