AI-103:Developing AI Apps and Agents on Azure テキスト分析ソリューションの実装 問6
テキスト分析ソリューションの実装/音声ソリューション国際会議のオンライン配信で、登壇者が英語で話す音声を聞きながら、視聴者が日本語の字幕を数秒以内の遅延で見られるようにしたい状況です。登壇者の音声はマイクからストリームとして入力されます。利用する機能として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「テキスト分析ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Speech の音声合成で、英語の台本テキストから日本語の音声を生成して配信する
- BAzure Speech のバッチ文字起こしで英語の文字起こしを作成し、会議の終了後に Azure Translator のドキュメント翻訳で日本語にする
- CAzure Speech の音声翻訳で、英語の音声ストリームを日本語のテキストへ逐次翻訳して字幕として配信する
- DAzure Translator のカスタム翻訳モデルを学習し、英語の音声ファイルをアップロードして日本語に変換する
正解:C
解説
ストリーム入力の音声を、遅延を抑えて別の言語の字幕にするには、Azure Speech の音声翻訳が適しています。音声認識と翻訳を続けて行い、認識中の途中結果や確定した翻訳テキストを逐次受け取れます。バッチ文字起こしは録音済みのファイルを対象にした非同期処理で、会議の終了後にしか結果を得られません。音声合成はテキストを音声にする機能、カスタム翻訳はテキスト翻訳の品質を調整する機能です。
選択肢ごとの解説
- A誤り。音声合成はテキストから音声を作る機能で、登壇者の音声を認識して翻訳する用途ではありません。
- B誤り。バッチ文字起こしと文書翻訳は会議終了後の処理となり、数秒以内の字幕表示という要件を満たしません。
- C正しい。音声翻訳は音声ストリームを認識して翻訳したテキストを逐次返すため、リアルタイムの字幕に使えます。
- D誤り。カスタム翻訳はテキストの翻訳モデルを調整する機能で、音声ファイルを入力として受け付けるものではありません。