過去問ドリル

AI-103:Developing AI Apps and Agents on Azure 情報抽出ソリューションの実装 問3

情報抽出ソリューションの実装/ドキュメントからのコンテンツ抽出

法務部が、契約書 PDF から、見出しの階層・段落・表の構造を保ったまま Markdown 形式でテキストを取り出し、構造を単位とするチャンク分割に使いたい状況です。利用するサービスとして適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「情報抽出ソリューションの実装」に対応。実際の試験問題ではありません)

正解:D

解説

Azure Content Understanding のドキュメント向けアナライザーは、ページ・段落・表などのレイアウトを解析し、構造を保った Markdown 形式の内容を出力できます。この出力は、見出しや表を単位にしたチャンク分割など、RAG の前処理に適しています。文字を取り出すだけの OCR や、翻訳・要約の機能では、構造を保った抽出という要件を満たせません。

選択肢ごとの解説

  • A誤り。OCR は文字の読み取りが中心で、見出し階層や表を保った Markdown 形式の構造化出力を直接得る用途の機能ではありません。
  • B誤り。ドキュメント翻訳は書式を保った翻訳ファイルを出力するもので、構造を保ったテキスト抽出が目的ではありません。
  • C誤り。要約は内容を短くまとめる機能で、原文の構造を保ったまま取り出すことはできません。
  • D正しい。レイアウト解析と Markdown 形式の出力により、構造を単位としたチャンク分割に使えます。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く