AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問2
コンピューター ビジョン ソリューションの実装/マルチモーダル理解ワークフロー不動産会社が、数万件の物件写真に代替テキストを付けます。社内のアクセシビリティ指針として「日本語で80文字以内、間取りの種類・採光・床材を必ず含め、広告的な誇張表現を使わない」が定められており、生成結果をこの指針に沿わせる必要があります。実装方針として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)
- AAzure Vision の画像分析でキャプションを生成し、返された文をそのまま代替テキストとして登録する
- BAzure Vision の OCR(Read)で写真内の文字を読み取り、読み取れた文字列を代替テキストとして登録する
- CAzure Vision の物体検出で家具や設備の位置を取得し、検出結果の座標を代替テキストとして登録する
- D画像入力に対応したマルチモーダルチャットモデルに、指針をシステムメッセージとして与えたうえで写真を送り、代替テキストを生成させる
正解:D
解説
文体・文字数・必須項目・禁止表現といった独自の指針に沿った説明文を生成するには、指示に従って出力を調整できるマルチモーダルチャットモデルを使い、指針をシステムメッセージに記述するのが適切です。画像分析のキャプションは汎用の説明文を返す機能で、自社の指針を細かく反映させる用途には向きません。必要に応じて、出力の文字数や必須項目を満たしているかを検証する処理をアプリ側に加えることもできます。
選択肢ごとの解説
- A誤り。キャプション生成は汎用的な説明文を返すもので、文字数や必須項目、表現の制約を指針どおりに制御できません。
- B誤り。OCR は写真に写る文字を読み取る機能で、物件の特徴を説明する文章は作れません。
- C誤り。物体検出は物体の位置とラベルを返すもので、指針に沿った説明文にはなりません。座標は代替テキストとして意味をなしません。
- D正しい。指針を与えたマルチモーダルモデルなら、写真の内容を理解しつつ、独自の文体や条件に沿った代替テキストを生成できます。