AIF-C01:AWS Certified AI Practitioner AI と機械学習の基礎 問9
AI と機械学習の基礎/ML 開発ライフサイクル(データ収集・学習・評価・デプロイ・MLOps)データサイエンティストが、複数のモデルとハイパーパラメーターを試して最良のモデルを選定しました。本番運用でどの程度の性能が出るかを、選定の過程の影響を受けない偏りの少ない形で見積もりたいと考えています。最終的な性能評価に使うべきデータはどれですか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「AI と機械学習の基礎」に対応。実際の試験問題ではありません)
- A学習に使用したデータ(学習データ)
- Bハイパーパラメーターの調整に繰り返し使用したデータ(検証データ)
- C学習・調整のいずれにも使用せず、最後まで取り分けておいたデータ(テストデータ)
- D学習データと検証データを合わせた全データ
正解:C
解説
データは通常、学習用・検証用・テスト用に分割します。検証データはモデル選択やハイパーパラメーター調整で繰り返し参照するため、それに対して最適化が進み、性能が楽観的に出やすくなります。最終的な汎化性能は、学習にも調整にも使っていないテストデータで一度だけ評価するのが基本です。学習データでの評価は、過学習を見逃す原因になります。
選択肢ごとの解説
- A誤り。学習データはモデルがすでに適合しているデータで、未知のデータへの性能を表さず、過学習を見逃します。
- B誤り。検証データは調整のために繰り返し参照しており、選定の過程の影響を受けるため、最終評価の見積もりが楽観的になります。
- C正しい。学習・調整に一切使わず取り分けたテストデータが、未知のデータへの性能を偏りなく見積もる用途に合います。
- D誤り。学習に使ったデータを含むため、モデルが既に見たデータでの評価となり、汎化性能を反映しません。