AI-901:Microsoft Azure AI Fundamentals Microsoft Foundry による AI ソリューションの実装 問13
Microsoft Foundry による AI ソリューションの実装/情報抽出社内研修の動画が大量にあります。動画ごとに、シーン単位の内容の要約や、話された内容の文字起こしといった情報を、定義した形式で取り出して検索に使いたい状況です。利用する機能として適切なものはどれですか。
当サイトのオリジナル問題(AI-901:Microsoft Azure AI Fundamentalsの出題範囲「Microsoft Foundry による AI ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Speech のバッチ文字起こしのみを使い、映像の内容は扱わない
- BAzure Vision の画像分析を、動画から切り出した全フレームに個別に適用する
- CAzure Content Understanding のアナライザー(動画向け)を使って、動画から情報を抽出する
- D画像生成モデルに動画の説明を入力し、要約用の新しい画像を作らせる
正解:C
解説
Azure Content Understanding は、文書や画像だけでなく音声や動画も入力として扱い、定義したフィールドの形式で情報を抽出できます。動画向けのアナライザー(シーン分割や文字起こしを行う事前構築済みのもの、またはカスタム)を使えば、映像の内容と音声の文字起こしの両方を踏まえた要約などを得られます。音声認識だけでは映像の情報が欠け、フレームごとの画像分析では動画全体の流れを踏まえた要約になりません。画像生成モデルは抽出の用途に使えません。
選択肢ごとの解説
- A誤り。音声認識では話された内容しか得られず、シーン単位の映像の要約などは扱えません。
- B誤り。フレーム単位の画像分析では、時間の流れや音声を踏まえたシーン要約にならず、実装も煩雑です。
- C正しい。動画向けのアナライザー(シーン分割や文字起こしを行う事前構築済みのもの、またはカスタム)で、映像と音声を踏まえた要約や文字起こしなどを定義した形式で取り出せます。
- D誤り。画像生成モデルは新しい画像を作る用途で、動画から情報を抽出する機能ではありません。