AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問6
コンピューター ビジョン ソリューションの実装/マルチモーダル理解ワークフロー人材育成部門が、1本あたり1〜2時間の社内研修動画を数百本蓄積しています。各動画について、場面ごとの要約・話された内容の文字起こし・画面に映った資料のタイトルを、あらかじめ定義した項目の構造化データとして取り出し、検索インデックスに登録したい状況です。利用するサービスとして適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Speech のバッチ文字起こしで動画の音声を文字に変換し、その文字起こしの全文を要約して項目を埋める
- B動画ファイルを画像として画像入力対応のチャットモデルのメッセージに添付し、項目を JSON で出力させる
- CAzure Content Understanding のビデオ向けアナライザーに、抽出したい項目をスキーマとして定義して動画を入力する
- DAzure Vision の OCR(Read)で動画に映った文字を読み取り、読み取った文字列から各項目を組み立てる
正解:C
解説
映像と音声の両方から場面単位の情報を取り出して、定義した項目の構造化データにするには、Azure Content Understanding のビデオ向けアナライザーが適しています。アナライザーにフィールドのスキーマを定義しておくと、セグメントごとの要約や文字起こし、映像に映った内容を、決まった形式で受け取れます。音声のみや文字のみを扱うサービスでは、映像の場面情報が欠け、要件の項目を満たせません。
選択肢ごとの解説
- A誤り。音声だけを文字にするため、画面に映った資料のタイトルなど映像側の情報が得られず、場面ごとの構造化もできません。
- B誤り。チャットモデルのメッセージに添付できるのは画像であり、動画ファイルをそのまま入力して場面単位の分析を得る用途の使い方ではありません。
- C正しい。ビデオ向けアナライザーにスキーマを定義して動画を解析させることで、場面ごとの要約・文字起こし・映像上の情報を構造化して取得できます。
- D誤り。OCR は画像中の文字を読み取る機能で、場面の要約や話された内容の文字起こしは得られません。