本文へ移動
cotomu FDE

RAGへ文書を取り込む前に、表・画像・重複の読み取りを確かめる

RAGの文書取り込み品質を、元文書と抽出結果の対比で判定。表・画像・重複を合格、再処理、除外に分け、再投入条件まで記録する、自社向けの具体的な受入基準を示します。

執筆cotomu FDE 編集部
監修岩崎 裕馬

RAGの文書取り込み品質は、元文書の意味を抽出結果からたどれるかで判定する。パーサーの処理完了だけでは受入条件を満たさない。本文、見出し、表、画像を元文書と同じ箇所で見比べ、「合格」「再処理」「除外」に分けるのが出発点になる。

特に、情報を担う表の分割・欠落、画像内情報のテキスト化不足、同一内容や旧版の重複は、登録前の除外条件にする。ただし、どの崩れまで許容するかは文書の用途で変わる。自社で扱う形式とレイアウトごとに、検索で答えを返すために欠かせない情報を先に定める必要がある。

RAGの文書取り込み品質は「抽出できた」だけでは決まらない

抽出結果に文字が並んでいても、元文書の構造が失われていれば、検索に使う単位としては受け入れにくい。見出しから本文が切り離される、表のヘッダーと値の対応が崩れる、図の結論だけが消える、といった状態では、個々の文字が正しくても意味を誤る余地がある。

製品の機能説明と、自社が行う受入検査も分けて考えたい。2026年9月21日時点のGoogle CloudによるGemini layout parserの公式説明では、表、図、リスト、見出しなどの要素と文脈上の関係を識別し、図・グラフ・表をテキスト記述として注釈できるとしている。また、抽出内容を意味的なまとまりに分け、祖先見出しや表ヘッダーなどの文脈情報を付加すると説明している。これは同製品の仕様であり、他のパーサーにも同じ性能があるという意味ではない。

さらに同じ公式ページには、PDFの複数ページにまたがる表が二つに分かれる場合があること、DOCXとPPTXでは入れ子表、XLSXでは複数表の検出に制約があることも示されている。対応形式に含まれているから、その形式のあらゆるレイアウトを受け入れられるとは限らない。機能一覧を見た後に残る問いは、「自社の文書で、どの欠落を不合格とするか」である。

元文書と抽出結果を同じ箇所で対比する

受入検査は、情報の役割ごとに元文書と抽出結果を対比して進める。文書全体への印象では、欠落した構造と影響範囲を特定できない。次の区分は、上記の製品仕様と、後述するNISTの試験・記録に関する一般原則を基にした実務上の提案であり、原典が定める分類や義務ではない。

  • 本文:段落の欠落、順序の入れ替わり、文字化けがなく、判断に必要な条件文や否定表現を読めるか。
  • 見出しとの結び付き:抽出された本文が、元文書の章・節や祖先見出しと対応しているか。
  • 表:表題、ヘッダー、行と列、注記が対応し、値が何を表すかを読み取れるか。ページをまたぐ表は前後を続けて確認する。
  • 画像:装飾画像ではなく情報を担う図・グラフについて、検索可能なテキストに必要な内容が表現されているか。
  • 重複:同じ内容の再掲、別名ファイル、旧版が混在し、どれを採用したか不明になっていないか。

検査対象は抽出文字列に限らない。元文書の該当ページや該当要素と抽出結果を一対にし、どの構造が保たれ、どこが失われたかを記録する。見出しを失った本文と、ヘッダーを失った表は、異なる不具合として扱い、同じ「文字の抽出成功」にまとめない。

合格・再処理・除外を決める判断表

次の判断表も、出典の一般原則を基にした実務上の提案であり、原典所定の分類・義務ではない。処置は、情報の役割、元文書との差、是正可能性から決める。採用した一次情報には、この判断にそのまま使える各社共通の数値閾値が示されていないためだ。

対比で見つかった状態判定処置台帳に残す再投入条件
判断に必要な本文が抽出され、見出しとの対応も追える合格登録対象にする文書または処理条件が変わったときに再検査
本文は読めるが、章・節との結び付きが失われている再処理見出しを保持する設定や分割方法を見直す見出しと本文の対応を抽出結果で確認できること
情報を担う表が分割され、ヘッダーと値の対応が欠けている再処理。直せなければ除外表を一体として扱える別処理を試し、元表と再対比する表題、ヘッダー、行列、注記の意味を追えること
情報を担う表の一部が欠落し、再処理後も復元できない除外不完全な状態では登録しない欠落のない原本または処理方法を用意できること
情報を担う画像の内容が検索可能なテキストになっていない再処理。直せなければ除外画像を扱える処理へ切り替え、説明と原図を対比する検索に必要な内容がテキストで確認できること
同一内容または旧版が重複し、採用版を特定できない除外採用版を決めるまで登録しない採用版と除外版、その根拠を識別できること
重複はあるが、採用版と除外版を識別できる合格採用版だけを登録する版の関係と選択理由が台帳に残っていること

たとえば、表が二つのチャンクに分かれていても、後半にヘッダーが引き継がれ、値の意味を一意に読めるなら、直ちに除外とは限らない。反対に、分割によって列の意味が分からなくなれば、文字がすべて残っていても合格にはしない。画像も同様で、装飾の説明不足と、業務上の判断を担うグラフの説明欠落を同じ重さで扱わない。用途に必要な情報が失われたかが境界になる。

重複では「似た文書がある」ことだけを不合格理由にしない。問題は、同一内容や旧版が検索対象に並び、採用すべき内容を追跡できない状態である。版の関係を確認し、採用版だけを登録し、除外した版と理由を台帳に残す。これにより、後から文書を差し替える際にも再投入の起点が分かる。

台帳は判定結果ではなく再現条件を残す

2026年9月21日時点のNIST AI RMF PlaybookのMEASURE 1.1は、目的への適合や主張どおりの動作を示す試験手順と指標を特定し、性能の許容限界と、限界を外れた場合の是正案を定めることを提案している。また、NIST AI RMF PlaybookのMAP 2.3は、データの選択・準備・分析に関する前提や手法、既知の制約、クリーニング方法、データ系譜の記録を提案し、既知の誤り、ノイズ、冗長性の有無を記録項目の例に挙げる。両ページは確認日時点で日まで特定できる公開日・更新日を確認できない。したがって、2026年9月21日は確認日として記載している。

これらの一般原則を文書取り込みへ適用するなら、台帳には少なくとも次を結び付ける。これは記事が提案する実務上の方法であり、NIST所定の記録様式や義務ではない。

  • 元文書と、その版を識別できる情報
  • 使用したパーサー名・版または処理条件
  • 抽出結果
  • 本文、見出し、表、画像、重複ごとの判定
  • 既知の例外と制約
  • 再処理で行った是正内容
  • 除外理由と再投入条件

「除外」という判定だけでは、別の処理方法を試すべきか、原本の更新を待つべきか判断できない。表のヘッダーを復元できれば再投入する、画像の要点を検索可能なテキストで確認できれば再投入する、採用版を確定できれば重複を解消して再投入する、という条件まで書く。再投入条件を伴う除外は、対象を管理された保留として扱える。

自社で実行する範囲を決める

全ファイルを同じ深さで検査する前に、実際に扱うファイル形式とレイアウトを棚卸しする。複数ページの表、入れ子表、複数表を含むシート、情報を担う画像など、構造上の難所を含む文書を検査対象に入れる。製品が対応をうたう形式でも、自社の難所で元文書との対応を保てるかは別の判定である。

実行条件は三つに絞れる。第一に、元文書と抽出結果を同じ箇所で対比できること。第二に、用途上欠かせない情報と、失われても検索判断を変えない情報を区別できること。第三に、再処理と除外の根拠を台帳で追跡できること。この三つを満たせないまま大量登録へ進むと、後から不具合を見つけても、対象範囲と再処理条件を切り分けにくい。

取り込み品質の確認は、RAG導入全体の一工程でもある。課題と対象業務から範囲を整理するならAI導入を実装まで進めるためのガイド、検証後の運用条件まで設計するならAI PoCを本番運用につなげる進め方も判断材料になる。

受入可否は、元文書と抽出結果の対比で決める。表・画像・重複について、用途に必要な意味が残っているかを確かめ、パーサーの処理完了通知だけで登録へ進めない。合格は登録へ、直せる崩れは再処理へ、直せない欠落や版不明の重複は除外へ進め、根拠と再投入条件を台帳に残す。この線を自社の形式とレイアウトごとに引けたとき、RAGへ文書を取り込む条件が実行可能な形になる。

文書形式の棚卸しや受入条件の設計を、自社のAI導入計画と一緒に整理したい場合は、FDE型支援の無料相談・AI活用診断をご利用ください。

FDE・AI実装ガイドへ戻る