過去問ドリル

AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問13

生成 AI とエージェント ソリューションの実装/生成AIシステムの最適化と運用化

RAG アプリのプロンプト テンプレートやモデルのバージョンを、複数の開発者が頻繁に変更しています。変更によって回答品質が以前より下がる事態を、本番へ反映する前に検出できる運用にしたい状況です。方法として適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)

正解:A

解説

変更による品質の低下を本番の前に検出するには、代表的な質問と期待する結果を持つ評価データセットを用意し、変更のたびに Foundry の評価を CI/CD パイプラインから自動で実行して、スコアが基準を満たさなければ反映を止める運用が適しています。一定の入力に対して改修前後のスコアを一貫した方法で比較できるため、回帰を早期に見つけられます。反映後のフィードバックの集計は、劣化が利用者に届いた後の検知になります。

選択肢ごとの解説

  • A正しい。同じデータセットでの自動評価と基準による判定により、反映前に品質の低下を検出できます。
  • B誤り。反映後のフィードバックでは、劣化が利用者に届いてからの検知になり、反映前に検出する要件を満たしません。
  • C誤り。数問の手作業では網羅性がなく、判断も担当者に依存します。再現性のある比較にもなりません。
  • D誤り。汎用ベンチマークはモデル一般の能力の目安であり、自社のプロンプトやデータに対するアプリの品質を表しません。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く