過去問ドリル

AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問7

基盤モデルの応用/基盤モデルの性能評価

文章要約用の基盤モデルを評価します。人手で作成した参照要約を用意し、モデルが生成した要約と比較して、参照要約の内容がどの程度含まれているかを自動で数値化したいと考えています。適切な評価指標はどれか。

当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)

正解:C

解説

ROUGE は要約の評価に広く使われる指標で、生成した要約と参照要約の単語やフレーズの重なりを、参照側の内容がどれだけ含まれるかという再現率を中心に測ります。BLEU は主に機械翻訳向けで精度寄りの指標です。F1 スコアは分類、パープレキシティは言語モデル自体の予測のしにくさを示す指標で、参照要約との比較には使いません。

選択肢ごとの解説

  • A誤り。BLEU は主に機械翻訳向けで、精度を重視した指標のため、要約の網羅性の評価には適しません。
  • B誤り。BERTScore は生成文と参照文の意味的な類似度を測る指標で、参照要約の内容がどれだけ含まれるか(重なりの再現率)を測る本問の目的とは評価の観点が異なります。
  • C正しい。ROUGE は参照要約との重なりを再現率中心に測るため、要約評価に適しています。
  • D誤り。パープレキシティはモデル自体の予測のしにくさを示し、参照要約との比較は行いません。
AIF-C01:AWS Certified AI Practitionerの問題を演習モードで解く