AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問2
生成 AI とエージェント ソリューションの実装/Foundry での生成アプリ構築RAG 方式の生成アプリで、プロンプト テンプレートを改修しました。改修前後で、テスト用の質問セットに対する回答が検索で取得した文書の内容に裏付けられているかを、人手を介さず数値で比較したいと考えています。Foundry の評価で使う評価器として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)
- A質問・取得コンテキスト・回答から、回答がコンテキストに基づいているかを採点するグラウンデッドネス評価器
- B回答の文法や読みやすさなど文章としての自然さを採点する流暢性評価器
- C回答に暴力や自傷に関する有害な内容が含まれる度合いを検出する安全性評価器
- D回答と用意した正解文の語の重なりを測り、一致の度合いを算出する F1 スコア評価器
正解:A
解説
回答が取得した文書に裏付けられているかを測るのは、グラウンデッドネス(接地性)の評価器です。テスト データセットに対して評価を実行し、改修前後のスコアを比較できます。流暢性は文章の自然さ、安全性評価器は有害コンテンツの度合い、F1 スコアは正解文との語の重なりを測るもので、いずれも接地の有無を直接は測りません。
選択肢ごとの解説
- A正しい。コンテキストに対する回答の裏付けを採点するため、要件に合います。
- B誤り。流暢性は文章の自然さを見る指標で、回答が文書に基づくかどうかは分かりません。
- C誤り。安全性評価器は有害コンテンツの検出が目的で、接地の度合いは測りません。
- D誤り。F1 スコアは用意した正解文との表層的な一致を測るもので、取得文書との整合や、正解文がない質問には使えません。