AIF-C01:AWS Certified AI Practitioner AI と機械学習の基礎 問4
AI と機械学習の基礎/AI/ML/深層学習の基本概念と用語画像分類モデルを作成したところ、学習データでの正解率は 99% ですが、学習に使っていない検証データでは 70% にとどまりました。このモデルの状態を表す用語として適切なものはどれですか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「AI と機械学習の基礎」に対応。実際の試験問題ではありません)
- A学習が不十分で、学習データのパターンすら捉えられていない過少適合(アンダーフィッティング)
- B検証データに学習データの情報が混入しているデータリーク(データ漏えい)
- C学習データに正解ラベルの誤り(ラベルノイズ)が多く含まれている状態
- D学習データに過度に適合し、未知のデータに汎化できていない過学習(オーバーフィッティング)
正解:D
解説
学習データでは高精度なのに未知のデータで精度が大きく下がる状態は、過学習(オーバーフィッティング)です。学習データのノイズまで覚えてしまい汎化性能が低いことを指します。対策には、学習データの追加、正則化、モデルの単純化、早期終了などがあります。
選択肢ごとの解説
- A誤り。過少適合は学習データに対する精度自体が低い状態で、本件は学習データで 99% と高いため当てはまりません。
- B誤り。データリークが起きていれば、検証データの精度はむしろ高く出るはずで、本件の状況と逆です。
- C誤り。ラベルノイズが多い場合は学習データでの精度も上がりにくく、学習 99%・検証 70% という過学習特有の大きな乖離は説明できません。
- D正しい。学習データには高精度で未知のデータで精度が落ちる、過学習の典型的な症状です。