過去問ドリル

AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問13

基盤モデルの応用/基盤モデルの性能評価

質問応答用の基盤モデルを評価しています。人手で作成した参照回答と、モデルの回答とで、使われている単語は異なるものの、意味は同じであることが多くあります。単語の一致ではなく、意味的な近さを自動で数値化したいと考えています。適切な評価指標はどれか。

当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)

正解:D

解説

BERTScore は、生成文と参照文の各トークンを埋め込みベクトルに変換し、その類似度で意味的な近さを評価する指標です。言い換えなどで単語が異なっても、意味が近ければ高いスコアになります。BLEU と ROUGE は語句や n-gram の重なりに基づくため、同義の別表現を低く評価しがちです。パープレキシティは参照回答との比較ではなく、言語モデルの予測しにくさを示します。

選択肢ごとの解説

  • A誤り。BLEU は n-gram の一致を見る指標で、同義の別表現を適切に評価できません。
  • B誤り。ROUGE は語句の重なりに基づくため、単語が異なる同義表現を低く評価しがちです。
  • C誤り。パープレキシティは参照回答との意味的な近さではなく、予測しにくさを表す指標です。
  • D正しい。埋め込みの類似度に基づき、単語が異なっても意味的な近さを評価できます。
AIF-C01:AWS Certified AI Practitionerの問題を演習モードで解く