AI-103:Developing AI Apps and Agents on Azure 情報抽出ソリューションの実装 問3
情報抽出ソリューションの実装/ドキュメントからのコンテンツ抽出法務部が、契約書 PDF から、見出しの階層・段落・表の構造を保ったまま Markdown 形式でテキストを取り出し、構造を単位とするチャンク分割に使いたい状況です。利用するサービスとして適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「情報抽出ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Vision の OCR(Read)で、ページ上の文字を行単位のテキストとして取り出す
- BAzure Translator のドキュメント翻訳で、PDF の書式を保ったまま別の言語のファイルを出力する
- CAzure Language の要約で、契約書全体の要点をまとめた文章を生成する
- DAzure Content Understanding のドキュメント向けアナライザーで、レイアウトを解析して Markdown 形式の出力を得る
正解:D
解説
Azure Content Understanding のドキュメント向けアナライザーは、ページ・段落・表などのレイアウトを解析し、構造を保った Markdown 形式の内容を出力できます。この出力は、見出しや表を単位にしたチャンク分割など、RAG の前処理に適しています。文字を取り出すだけの OCR や、翻訳・要約の機能では、構造を保った抽出という要件を満たせません。
選択肢ごとの解説
- A誤り。OCR は文字の読み取りが中心で、見出し階層や表を保った Markdown 形式の構造化出力を直接得る用途の機能ではありません。
- B誤り。ドキュメント翻訳は書式を保った翻訳ファイルを出力するもので、構造を保ったテキスト抽出が目的ではありません。
- C誤り。要約は内容を短くまとめる機能で、原文の構造を保ったまま取り出すことはできません。
- D正しい。レイアウト解析と Markdown 形式の出力により、構造を単位としたチャンク分割に使えます。