過去問ドリル

AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問7

コンピューター ビジョン ソリューションの実装/マルチモーダル理解ワークフロー

インテリア販売会社が、数十万点の商品画像を Azure AI Search で検索できるようにします。商品画像にはタグもキャプションも付いておらず、利用者が「落ち着いた雰囲気の木目調の部屋」のような自然文を入力すると、雰囲気が近い画像が上位に返る検索にしたい状況です。構成として適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)

正解:A

解説

自然文と画像の雰囲気を直接比較するには、テキストと画像を同じベクトル空間に写すマルチモーダル埋め込みを使います。画像側は事前にベクター化してインデックスへ登録し、クエリのテキストも同じモデルでベクター化して、Azure AI Search のベクター検索で近い画像を返します。OCR は画像内の文字、ファイル名やタグの一致は付与された語彙に依存するため、「雰囲気が近い」という要件には届きません。

選択肢ごとの解説

  • A正しい。マルチモーダル埋め込みにより、テキストと画像を同一空間で比較でき、タグなしの画像にも自然文で類似検索できます。
  • B誤り。商品画像に文字が写っているとは限らず、OCR の結果は雰囲気や素材感を表しません。
  • C誤り。ファイル名は画像の見た目を表さないため、ベクター化しても画像の雰囲気とは対応しません。
  • D誤り。タグは固定の語彙で、自然文の表現と完全一致するとは限らず、雰囲気の近さによる順位付けもできません。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く