AI-103:Developing AI Apps and Agents on Azure 情報抽出ソリューションの実装 問2
情報抽出ソリューションの実装/取得/グラウンディングパイプラインの構築社内文書を Azure AI Search で RAG に使います。文書の中には、紙をスキャンしたテキスト層のない PDF が多数含まれており、これらの文字内容も検索対象にして、検索結果のチャンクを根拠として利用したい状況です。インデクサーの構成として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「情報抽出ソリューションの実装」に対応。実際の試験問題ではありません)
- Aインデクサーの既定のドキュメント解析によるテキスト抽出のみを使い、スキルセットは構成しない
- BPDF をバイナリのままインデックスのフィールドへ格納し、クエリ時にモデルが内容を読み取るようにする
- Cスキルセットに OCR・テキスト分割・埋め込みの各スキルを構成し、チャンクごとにテキストとベクターをインデックスへ登録する
- DPDF ファイルのバイト列を埋め込みモデルへそのまま入力してベクター化し、インデックスへ登録する
正解:C
解説
テキスト層のないスキャン PDF は、既定のテキスト抽出では文字が取れません。インデクサーにスキルセットを構成し、OCR で文字を取り出し、テキスト分割でチャンク化し、埋め込みスキルでベクトルを付与してインデックスに登録すると、RAG の根拠として使えます。これにより、取り込み時のエンリッチメントを検索パイプラインの中で完結できます。
選択肢ごとの解説
- A誤り。既定の解析ではスキャン画像の文字は取り出せず、検索対象になりません。
- B誤り。バイナリのままではテキスト検索もベクター検索もできず、クエリ時に読み取る方式は検索インデックスの役割にも合いません。
- C正しい。OCR・分割・埋め込みをスキルセットで組み合わせることで、スキャン文書も検索可能なチャンクとして取り込めます。
- D誤り。埋め込みモデルはテキストの意味をベクトル化するもので、ファイルのバイト列は入力として意味をなしません。