AI-103:Developing AI Apps and Agents on Azure コンピューター ビジョン ソリューションの実装 問4
コンピューター ビジョン ソリューションの実装/画像/動画生成の設計と実装旅行会社が、社員が入力する「夕焼けの海」のような短い一言から、広告用の画像を生成するアプリを Foundry で作ります。入力が短いと生成画像の構図や雰囲気が毎回ばらつくため、社内の広告ガイドライン(色調・構図・禁止モチーフ)に沿った画像を安定して得たい状況です。設計として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「コンピューター ビジョン ソリューションの実装」に対応。実際の試験問題ではありません)
- A生成のたびに画像生成モデルの出力枚数を増やし、返された画像のうち最も気に入ったものを社員が選ぶ
- Bチャットモデルにガイドラインをシステムメッセージで与えて、短い入力を詳細な描写のプロンプトに書き換えさせ、そのプロンプトを画像生成モデルへ渡す
- C画像生成モデルのデプロイでコンテンツフィルターの重大度しきい値を調整し、広告に不適切な構図を遮断する
- D生成された画像を Azure Vision の画像分析でキャプション化し、そのキャプションを次回のプロンプトとして画像生成モデルに入力する
正解:B
解説
短い入力のまま画像生成モデルに渡すと、モデルが補う要素が毎回変わるため、結果がばらつきます。前段でチャットモデルを使い、ガイドラインを指示として与えて入力を詳細な描写へ書き換える(プロンプトの拡張)設計にすると、色調や構図の指定を安定して反映できます。出力枚数の増加や事後の選別は、ばらつきを減らすのではなく吸収するだけです。コンテンツフィルターは有害表現の遮断用であり、広告上の構図ルールを守らせる機能ではありません。
選択肢ごとの解説
- A誤り。出力枚数を増やしても、ガイドラインに沿わない画像が混ざる割合は変わらず、選別の手間とコストが増えるだけです。
- B正しい。前段のチャットモデルで入力を詳細なプロンプトに書き換えることで、ガイドラインを反映した指示を画像生成モデルへ一貫して渡せます。
- C誤り。コンテンツフィルターは暴力・性的などの有害カテゴリを重大度で遮断する機能で、色調や構図といった広告上のルールを制御するものではありません。
- D誤り。生成済みの画像を説明文にして再投入しても、元の入力が短いという問題は解消されず、ガイドラインも反映されません。