過去問ドリル

AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問2

生成 AI とエージェント ソリューションの実装/Foundry での生成アプリ構築

RAG 方式の生成アプリで、プロンプト テンプレートを改修しました。改修前後で、テスト用の質問セットに対する回答が検索で取得した文書の内容に裏付けられているかを、人手を介さず数値で比較したいと考えています。Foundry の評価で使う評価器として適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)

正解:A

解説

回答が取得した文書に裏付けられているかを測るのは、グラウンデッドネス(接地性)の評価器です。テスト データセットに対して評価を実行し、改修前後のスコアを比較できます。流暢性は文章の自然さ、安全性評価器は有害コンテンツの度合い、F1 スコアは正解文との語の重なりを測るもので、いずれも接地の有無を直接は測りません。

選択肢ごとの解説

  • A正しい。コンテキストに対する回答の裏付けを採点するため、要件に合います。
  • B誤り。流暢性は文章の自然さを見る指標で、回答が文書に基づくかどうかは分かりません。
  • C誤り。安全性評価器は有害コンテンツの検出が目的で、接地の度合いは測りません。
  • D誤り。F1 スコアは用意した正解文との表層的な一致を測るもので、取得文書との整合や、正解文がない質問には使えません。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く