AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問13
基盤モデルの応用/基盤モデルの性能評価質問応答用の基盤モデルを評価しています。人手で作成した参照回答と、モデルの回答とで、使われている単語は異なるものの、意味は同じであることが多くあります。単語の一致ではなく、意味的な近さを自動で数値化したいと考えています。適切な評価指標はどれか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)
- ABLEU(参照訳との n-gram の一致の精度を評価する指標)
- BROUGE(参照テキストとの単語や n-gram の重なりを評価する指標)
- Cパープレキシティ(言語モデルが次の単語をどれだけ予測しにくいかを表す指標)
- DBERTScore(埋め込みの類似度で、生成文と参照文の意味的な近さを評価する指標)
正解:D
解説
BERTScore は、生成文と参照文の各トークンを埋め込みベクトルに変換し、その類似度で意味的な近さを評価する指標です。言い換えなどで単語が異なっても、意味が近ければ高いスコアになります。BLEU と ROUGE は語句や n-gram の重なりに基づくため、同義の別表現を低く評価しがちです。パープレキシティは参照回答との比較ではなく、言語モデルの予測しにくさを示します。
選択肢ごとの解説
- A誤り。BLEU は n-gram の一致を見る指標で、同義の別表現を適切に評価できません。
- B誤り。ROUGE は語句の重なりに基づくため、単語が異なる同義表現を低く評価しがちです。
- C誤り。パープレキシティは参照回答との意味的な近さではなく、予測しにくさを表す指標です。
- D正しい。埋め込みの類似度に基づき、単語が異なっても意味的な近さを評価できます。