AI-103:Developing AI Apps and Agents on Azure テキスト分析ソリューションの実装 問3
テキスト分析ソリューションの実装/音声ソリューション弁護士事務所が、複数人が参加する面談の録音ファイルを、誰が話した内容かが分かる形で文字起こししたい状況です。録音は保管済みで、処理にリアルタイム性は求めません。利用する機能として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「テキスト分析ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Speech のバッチ文字起こしで、話者の分離(ダイアライゼーション)を有効にする
- BAzure Speech の音声合成で、録音ファイルの内容を話者ごとの声で再生成する
- CAzure Language の PII 検出で、録音ファイルから話者の氏名を検出して発話を振り分ける
- DAzure Translator のテキスト翻訳で、録音ファイルの内容を話者ごとの文章に変換する
正解:A
解説
保存済みの録音を非同期でまとめて文字起こしするには、Azure Speech のバッチ文字起こしが適しています。話者の分離(ダイアライゼーション)を有効にすると、結果の各発話に話者を区別する情報が付き、誰の発言かを判別しやすくなります。音声合成・PII 検出・翻訳は、いずれも話者別の文字起こしを行う機能ではありません。
選択肢ごとの解説
- A正しい。バッチ文字起こしの話者分離で、録音を発話者ごとに区別したテキストにできます。
- B誤り。音声合成はテキストから音声を作る機能で、録音の文字起こしは行いません。
- C誤り。PII 検出は入力されたテキストの個人情報を検出する機能で、録音を直接受け取って話者を分けることはできません。
- D誤り。Translator はテキストや文書の翻訳を行うもので、録音ファイルを話者別に文字起こしする機能ではありません。