AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問14
生成 AI とエージェント ソリューションの実装/生成AIシステムの最適化と運用化社内向けチャット アプリは、数千トークンに及ぶ固定のシステム メッセージとツール定義に、利用者ごとの短い質問を付けて Azure OpenAI のデプロイへ送っています。現在は利用者名や現在時刻などの情報をプロンプトの冒頭に入れており、入力コストと応答の待ち時間が課題です。回答内容を変えずに改善する方法として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)
- A固定のシステム メッセージを要約して短くし、利用者名や時刻は冒頭に残したまま送る
- B固定のシステム メッセージとツール定義を先頭にまとめ、利用者名・時刻・質問などの可変部分を末尾に置く
- C利用者名や時刻の情報を毎回異なる位置に挿入し、要求ごとにプロンプトの構造を変えて負荷を分散させる
- D最大出力トークン数を小さく設定して、1回の要求あたりの処理量を減らす
正解:B
解説
Azure OpenAI のプロンプト キャッシュは、一定以上の長さのプロンプトで先頭部分が過去の要求と一致する場合に、その部分の処理を再利用して入力コストと待ち時間を減らします。そのため、固定のシステム メッセージやツール定義を先頭にまとめ、利用者名や時刻、質問のように要求ごとに変わる部分を末尾に置く構成にします。可変の情報が冒頭にあると、先頭が毎回異なってキャッシュが効きません。
選択肢ごとの解説
- A誤り。要約で短くすると内容が変わるおそれがあり、可変の情報が冒頭に残るため、先頭の一致によるキャッシュも効きません。
- B正しい。固定部分を先頭に置いて先頭が一致するようにすることで、プロンプト キャッシュが効き、回答内容を変えずに入力コストと待ち時間を減らせます。
- C誤り。構造を要求ごとに変えると先頭の一致が成立せず、キャッシュが効かなくなります。負荷分散の効果もありません。
- D誤り。最大出力トークン数の制限は出力の長さを切り詰めるもので、回答内容が変わる可能性があります。入力側の固定部分のコストには影響しません。