AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問13
生成 AI とエージェント ソリューションの実装/生成AIシステムの最適化と運用化RAG アプリのプロンプト テンプレートやモデルのバージョンを、複数の開発者が頻繁に変更しています。変更によって回答品質が以前より下がる事態を、本番へ反映する前に検出できる運用にしたい状況です。方法として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)
- A代表的な質問と期待する回答の評価データセットを用意し、CI/CD パイプラインで Foundry の評価を自動実行して、スコアが基準を下回れば反映を止める
- B反映後に利用者から寄せられる評価ボタンの結果を集計し、低評価が増えたら変更を戻す
- C変更した開発者が数問を手作業で試し、問題がなければ本番へ反映する
- Dモデルの提供元が公開している汎用ベンチマークの成績を比較し、成績が高いほうのバージョンを採用する
正解:A
解説
変更による品質の低下を本番の前に検出するには、代表的な質問と期待する結果を持つ評価データセットを用意し、変更のたびに Foundry の評価を CI/CD パイプラインから自動で実行して、スコアが基準を満たさなければ反映を止める運用が適しています。一定の入力に対して改修前後のスコアを一貫した方法で比較できるため、回帰を早期に見つけられます。反映後のフィードバックの集計は、劣化が利用者に届いた後の検知になります。
選択肢ごとの解説
- A正しい。同じデータセットでの自動評価と基準による判定により、反映前に品質の低下を検出できます。
- B誤り。反映後のフィードバックでは、劣化が利用者に届いてからの検知になり、反映前に検出する要件を満たしません。
- C誤り。数問の手作業では網羅性がなく、判断も担当者に依存します。再現性のある比較にもなりません。
- D誤り。汎用ベンチマークはモデル一般の能力の目安であり、自社のプロンプトやデータに対するアプリの品質を表しません。