AIF-C01:AWS Certified AI Practitioner 基盤モデルの応用 問9
基盤モデルの応用/基盤モデルを使うアプリの設計上の考慮(推論パラメーター・RAG・ベクターストア)契約書の長い条文を対象とする RAG アプリを Amazon Bedrock ナレッジベースで構築しています。検索は小さな単位で関連箇所を精度よく見つけたい一方、基盤モデルには該当箇所を含む前後の広い文脈も渡して回答させたいと考えています。取り込み時のチャンク分割の設定として適切なものはどれか。
当サイトのオリジナル問題(AIF-C01:AWS Certified AI Practitionerの出題範囲「基盤モデルの応用」に対応。実際の試験問題ではありません)
- A親チャンクと子チャンクの入れ子構造で分割し、検索で見つけた子チャンクを親チャンクに置き換えて渡す階層的チャンク分割にする
- Bチャンクサイズを非常に小さく固定し、隣接するチャンクとの重複率を高くする固定サイズのチャンク分割にする
- C文書を分割せず、各文書をそのまま1つのチャンクとして扱うチャンク分割なしの設定にする
- D文の意味的な近さに基づいて区切り位置を決める、セマンティックチャンク分割にする
正解:A
解説
階層的チャンク分割は、子チャンクと親チャンクの入れ子構造をつくります。検索時にはまず小さな子チャンクで関連箇所を探し、モデルへ渡す際はより広い親チャンクに置き換えます。そのため、検索の精度と回答に必要な文脈の広さを両立できます。固定サイズ分割や分割なしでは、この置き換えはできません。セマンティックチャンク分割は意味のまとまりで区切る方法で、親子の置き換えは行いません。
選択肢ごとの解説
- A正しい。小さな子チャンクで検索し、親チャンクで広い文脈を渡す要件に合致します。
- B誤り。固定サイズで小さくして重複を増やしても、検索精度は保てますが、モデルへ渡す文脈が広がるわけではありません。
- C誤り。分割しないと長い文書全体が1つのチャンクになり、小さな単位で関連箇所を絞り込む要件を満たせません。
- D誤り。セマンティックチャンク分割は意味のまとまりで区切る手法ですが、検索後に親チャンクへ置き換える仕組みはありません。