AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問12
基盤モデルの応用/基盤モデルの性能評価社内向けの生成 AI アシスタントについて、回答が「自社のブランドのトーンに合った親しみやすい表現になっているか」を、リリース前に評価したいと考えています。参照回答との文字列の一致では判断しにくい観点です。適切な評価方法はどれか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)
- A評価者が回答を読み、トーンや親しみやすさを評価基準に沿って採点する人間による評価を行う
- B生成した回答と参照回答の単語の重なりを測る ROUGE のスコアを算出する
- C生成した回答と参照訳の n-gram の一致の精度を測る BLEU のスコアを算出する
- Dモデルが各単語をどれだけ予測しにくいかを示すパープレキシティを算出する
正解:A
解説
トーンや親しみやすさ、ブランドらしさといった主観的な品質は、自動指標では測りにくく、人間による評価が適しています。Amazon Bedrock のモデル評価では、自社の作業チームや AWS が管理する作業チームによる人間ベースの評価を選べます。ROUGE や BLEU は参照テキストとの重なりを見る指標、パープレキシティは言語モデルの予測しにくさを示す指標で、表現のトーンの適否は評価できません。
選択肢ごとの解説
- A正しい。主観的で文脈に依存するトーンの評価には、人間による評価が適しています。
- B誤り。ROUGE は参照との語句の重なりを測る指標で、トーンの適否は評価できません。
- C誤り。BLEU は主に機械翻訳で参照訳との一致を測る指標で、トーンの評価には向きません。
- D誤り。パープレキシティは言語モデルの予測のしにくさを示す指標で、表現の適否は判断できません。