AI-901:Microsoft Azure AI Fundamentals Microsoft Foundry による AI ソリューションの実装 問6
Microsoft Foundry による AI ソリューションの実装/テキストと音声の AI ソリューション利用者がマイクで話しかけた音声を、音声認識や音声合成の別サービスを組み合わせずに、モデル単体で受け取り、そのまま音声で返答する対話アプリを作りたい状況です。Foundry にデプロイするモデルとして適切なものはどれですか。
当サイトのオリジナル問題(AI-901:Microsoft Azure AI Fundamentalsの出題範囲「Microsoft Foundry による AI ソリューションの実装」に対応。実際の試験問題ではありません)
- Aテキストの意味をベクトル化するための埋め込みモデル
- Bテキストの説明から画像を出力する画像生成モデル
- Cテキストの入力とテキストの出力にのみ対応するチャットモデル
- D音声の入力と音声の出力に対応するマルチモーダルモデル
正解:D
解説
音声を入力として受け取り、音声で応答できるマルチモーダルモデルをデプロイすれば、音声認識や音声合成の別サービスを挟まずに音声対話を実現できます。埋め込みモデルは検索などに使うベクトルを出力するモデル、画像生成モデルは画像を出力するモデルです。テキストのみのチャットモデルは音声を直接扱えず、音声対話にはほかのサービスとの組み合わせが必要になります。
選択肢ごとの解説
- A誤り。埋め込みモデルはベクトルを返すモデルで、会話の応答を音声で返すことはできません。
- B誤り。画像生成モデルは画像を出力するモデルで、音声の入出力には対応しません。
- C誤り。テキストのみのモデルは音声を直接受け取れず、音声対話には音声認識や音声合成との組み合わせが必要です。
- D正しい。音声入出力に対応するマルチモーダルモデルをデプロイすれば、音声認識や音声合成の別サービスを挟まずに音声で対話できます。