過去問ドリル

AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問6

コンピューター ビジョン ソリューションの実装/マルチモーダル理解ワークフロー

人材育成部門が、1本あたり1〜2時間の社内研修動画を数百本蓄積しています。各動画について、場面ごとの要約・話された内容の文字起こし・画面に映った資料のタイトルを、あらかじめ定義した項目の構造化データとして取り出し、検索インデックスに登録したい状況です。利用するサービスとして適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)

正解:C

解説

映像と音声の両方から場面単位の情報を取り出して、定義した項目の構造化データにするには、Azure Content Understanding のビデオ向けアナライザーが適しています。アナライザーにフィールドのスキーマを定義しておくと、セグメントごとの要約や文字起こし、映像に映った内容を、決まった形式で受け取れます。音声のみや文字のみを扱うサービスでは、映像の場面情報が欠け、要件の項目を満たせません。

選択肢ごとの解説

  • A誤り。音声だけを文字にするため、画面に映った資料のタイトルなど映像側の情報が得られず、場面ごとの構造化もできません。
  • B誤り。チャットモデルのメッセージに添付できるのは画像であり、動画ファイルをそのまま入力して場面単位の分析を得る用途の使い方ではありません。
  • C正しい。ビデオ向けアナライザーにスキーマを定義して動画を解析させることで、場面ごとの要約・文字起こし・映像上の情報を構造化して取得できます。
  • D誤り。OCR は画像中の文字を読み取る機能で、場面の要約や話された内容の文字起こしは得られません。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く