過去問ドリル

AI-901:Microsoft Azure AI Fundamentals Microsoft Foundry による AI ソリューションの実装 問6

Microsoft Foundry による AI ソリューションの実装/テキストと音声の AI ソリューション

利用者がマイクで話しかけた音声を、音声認識や音声合成の別サービスを組み合わせずに、モデル単体で受け取り、そのまま音声で返答する対話アプリを作りたい状況です。Foundry にデプロイするモデルとして適切なものはどれですか。

当サイトのオリジナル問題(AI-901:Microsoft Azure AI Fundamentalsの出題範囲「Microsoft Foundry による AI ソリューションの実装」に対応。実際の試験問題ではありません)

正解:D

解説

音声を入力として受け取り、音声で応答できるマルチモーダルモデルをデプロイすれば、音声認識や音声合成の別サービスを挟まずに音声対話を実現できます。埋め込みモデルは検索などに使うベクトルを出力するモデル、画像生成モデルは画像を出力するモデルです。テキストのみのチャットモデルは音声を直接扱えず、音声対話にはほかのサービスとの組み合わせが必要になります。

選択肢ごとの解説

  • A誤り。埋め込みモデルはベクトルを返すモデルで、会話の応答を音声で返すことはできません。
  • B誤り。画像生成モデルは画像を出力するモデルで、音声の入出力には対応しません。
  • C誤り。テキストのみのモデルは音声を直接受け取れず、音声対話には音声認識や音声合成との組み合わせが必要です。
  • D正しい。音声入出力に対応するマルチモーダルモデルをデプロイすれば、音声認識や音声合成の別サービスを挟まずに音声で対話できます。
AI-901:Microsoft Azure AI Fundamentalsの問題を演習モードで解く