過去問ドリル

AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問12

基盤モデルの応用/基盤モデルの性能評価

社内向けの生成 AI アシスタントについて、回答が「自社のブランドのトーンに合った親しみやすい表現になっているか」を、リリース前に評価したいと考えています。参照回答との文字列の一致では判断しにくい観点です。適切な評価方法はどれか。

当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)

正解:A

解説

トーンや親しみやすさ、ブランドらしさといった主観的な品質は、自動指標では測りにくく、人間による評価が適しています。Amazon Bedrock のモデル評価では、自社の作業チームや AWS が管理する作業チームによる人間ベースの評価を選べます。ROUGE や BLEU は参照テキストとの重なりを見る指標、パープレキシティは言語モデルの予測しにくさを示す指標で、表現のトーンの適否は評価できません。

選択肢ごとの解説

  • A正しい。主観的で文脈に依存するトーンの評価には、人間による評価が適しています。
  • B誤り。ROUGE は参照との語句の重なりを測る指標で、トーンの適否は評価できません。
  • C誤り。BLEU は主に機械翻訳で参照訳との一致を測る指標で、トーンの評価には向きません。
  • D誤り。パープレキシティは言語モデルの予測のしにくさを示す指標で、表現の適否は判断できません。
AIF-C01:AWS Certified AI Practitionerの問題を演習モードで解く