AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問6
基盤モデルの応用/学習とファインチューニング特許文献や技術レポートなど、業界固有の用語が多い大量のラベルなしテキストを保有しています。入力と出力のペアは用意できませんが、基盤モデルにこの分野の用語や知識を学習させたいと考えています。適切な手法はどれか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)
- Aプロンプトと応答のペアを新たに作成し、基盤モデルのファインチューニングを行う
- Bラベルのない文書を使って、基盤モデルの継続的事前トレーニングを行う
- C文書を Amazon Bedrock ナレッジベースに登録し、検索結果をプロンプトに加える
- D大型モデルの出力を教師データにして、小型モデルへのモデル蒸留を行う
正解:B
解説
継続的事前トレーニングは、ラベルなしの大量テキストで既存の基盤モデルを追加学習し、特定ドメインの用語や知識に習熟させる手法です。入出力のペアを必要としません。ファインチューニングはラベル付きのペアが前提です。ナレッジベース(RAG)はモデル自体を変えず、推論時に文書を参照させる方法で、モデルに知識を学習させる手法ではありません。
選択肢ごとの解説
- A誤り。ファインチューニングにはラベル付きのペアが必要で、ペアを用意できない今回の前提に合いません。
- B正しい。ラベルなしのドメイン文書でモデルの知識を広げる用途に合致します。
- C誤り。ナレッジベースは推論時の参照であり、モデル自体にドメイン知識を学習させる手法ではありません。
- D誤り。モデル蒸留は小型モデルを作る手法で、ドメイン知識の学習が目的ではありません。