AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問7
コンピューター ビジョン ソリューションの実装/マルチモーダル理解ワークフローインテリア販売会社が、数十万点の商品画像を Azure AI Search で検索できるようにします。商品画像にはタグもキャプションも付いておらず、利用者が「落ち着いた雰囲気の木目調の部屋」のような自然文を入力すると、雰囲気が近い画像が上位に返る検索にしたい状況です。構成として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Vision のマルチモーダル埋め込みで画像とクエリのテキストを同じベクトル空間のベクターに変換し、画像のベクターをインデックスに登録してベクター検索する
- B全商品画像に OCR(Read)をかけて読み取れた文字をインデックスに登録し、入力された自然文を全文検索で照合する
- Cテキスト埋め込みモデルで画像のファイル名をベクター化してインデックスに登録し、入力された自然文のベクターと照合する
- DAzure Vision の画像分析でタグを自動付与してインデックスに登録し、入力された自然文からタグの完全一致で絞り込む
正解:A
解説
自然文と画像の雰囲気を直接比較するには、テキストと画像を同じベクトル空間に写すマルチモーダル埋め込みを使います。画像側は事前にベクター化してインデックスへ登録し、クエリのテキストも同じモデルでベクター化して、Azure AI Search のベクター検索で近い画像を返します。OCR は画像内の文字、ファイル名やタグの一致は付与された語彙に依存するため、「雰囲気が近い」という要件には届きません。
選択肢ごとの解説
- A正しい。マルチモーダル埋め込みにより、テキストと画像を同一空間で比較でき、タグなしの画像にも自然文で類似検索できます。
- B誤り。商品画像に文字が写っているとは限らず、OCR の結果は雰囲気や素材感を表しません。
- C誤り。ファイル名は画像の見た目を表さないため、ベクター化しても画像の雰囲気とは対応しません。
- D誤り。タグは固定の語彙で、自然文の表現と完全一致するとは限らず、雰囲気の近さによる順位付けもできません。