AI-901:Microsoft Azure AI Fundamentals Microsoft Foundry による AI ソリューションの実装 問23
Microsoft Foundry による AI ソリューションの実装/コンピュータービジョンと画像生成営業部門が、月別売上の棒グラフのスクリーンショットをアプリから送り、「このグラフで売上が最も高い月はいつですか。前の月と比べてどう変化していますか」という質問に、グラフの内容に基づいて文章で答えてもらいたい状況です。Foundry で利用するものとして適切なものはどれですか。
当サイトのオリジナル問題(AI-901:Microsoft Azure AI Fundamentalsの出題範囲「Microsoft Foundry による AI ソリューションの実装」に対応。実際の試験問題ではありません)
- A画像入力に対応したマルチモーダルチャットモデルに、スクリーンショットと質問を同じ要求として送る
- BAzure Vision の OCR(Read)でグラフ内の文字を読み取り、その文字列をそのまま質問への回答として表示する
- C画像生成モデルに質問とスクリーンショットを送り、回答が書き込まれた新しい画像を返させる
- Dテキストの意味をベクトル化する埋め込みモデルにスクリーンショットを送り、得られたベクトルから回答を取り出す
正解:A
解説
画像の内容を解釈し、質問に自然な文章で答えるには、画像入力に対応したマルチモーダルチャットモデルを使います。画像と質問を同じ要求に含めて送ると、モデルがグラフの形や目盛りの情報を踏まえて回答を生成できます。OCR は画像内の文字を読み取れますが、棒の高さの比較や変化の説明といった解釈や質問への回答までは行いません。画像生成モデルは新しい画像を出力するモデルで、画像を読み取って文章で答える用途のものではありません。埋め込みモデルは意味検索などに使うベクトルを返すだけで、回答の文章は返しません。
選択肢ごとの解説
- A正しい。画像入力に対応したマルチモーダルチャットモデルは、画像と質問を一緒に受け取り、画像の内容に基づく回答を文章で返せます。
- B誤り。OCR は画像内の文字を読み取る機能です。グラフの比較や変化を解釈して質問に答えることはできません。
- C誤り。画像生成モデルは新規画像を出力するためのモデルです。画像を読み取って文章で回答する用途には向きません。
- D誤り。埋め込みモデルが返すのはベクトルです。ベクトルから質問への回答の文章を得ることはできません。