AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問7
基盤モデルの応用/基盤モデルの性能評価文章要約用の基盤モデルを評価します。人手で作成した参照要約を用意し、モデルが生成した要約と比較して、参照要約の内容がどの程度含まれているかを自動で数値化したいと考えています。適切な評価指標はどれか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)
- ABLEU(主に機械翻訳の品質を、参照訳との一致の精度で評価する指標)
- BBERTScore(埋め込みの類似度で生成文と参照文の意味的な近さを評価する指標)
- CROUGE(生成テキストと参照テキストの重なりを、再現率を重視して評価する指標)
- Dパープレキシティ(言語モデルが次の単語をどれだけ予測しにくいかを表す指標)
正解:C
解説
ROUGE は要約の評価に広く使われる指標で、生成した要約と参照要約の単語やフレーズの重なりを、参照側の内容がどれだけ含まれるかという再現率を中心に測ります。BLEU は主に機械翻訳向けで精度寄りの指標です。F1 スコアは分類、パープレキシティは言語モデル自体の予測のしにくさを示す指標で、参照要約との比較には使いません。
選択肢ごとの解説
- A誤り。BLEU は主に機械翻訳向けで、精度を重視した指標のため、要約の網羅性の評価には適しません。
- B誤り。BERTScore は生成文と参照文の意味的な類似度を測る指標で、参照要約の内容がどれだけ含まれるか(重なりの再現率)を測る本問の目的とは評価の観点が異なります。
- C正しい。ROUGE は参照要約との重なりを再現率中心に測るため、要約評価に適しています。
- D誤り。パープレキシティはモデル自体の予測のしにくさを示し、参照要約との比較は行いません。