AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問8
生成 AI とエージェント ソリューションの実装/生成AIシステムの最適化と運用化問い合わせ対応アプリで、受信した問い合わせの大半は定型的な分類で足りますが、一部だけ複数の資料を突き合わせる複雑な推論が必要です。現状は全件を高性能な推論モデルへ送っており、コストと応答時間が課題です。品質を落とさず改善する方法として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)
- A全件をそのまま推論モデルへ送り、出力の最大トークン数を小さく制限して費用を抑える
- B全件を小型で低コストなモデルに統一し、複雑な問い合わせも同じモデルで処理する
- C同じ問い合わせを小型モデルと推論モデルの両方へ送り、より長い回答のほうを採用する
- D問い合わせの複雑さを先に判定し、定型的なものは小型モデルへ、複雑なものだけ推論モデルへ振り分ける
正解:D
解説
処理の難易度に偏りがある場合は、複雑さを判定して小型モデルと推論モデルへ振り分けるモデル ルーティング(複数モデルの組み合わせ)が有効です。定型分類は低コストで高速に処理し、推論モデルは本当に必要な問い合わせに限定できます。振り分けの精度は評価データで検証し、誤ルーティングによる品質低下を確認する必要があります。
選択肢ごとの解説
- A誤り。最大トークン数の制限は回答を途中で切り、複雑な問い合わせの品質を損ねます。推論モデルへ全件を送る点も変わりません。
- B誤り。複雑な問い合わせの品質が落ちるため、品質を維持する要件を満たしません。
- C誤り。両方を呼び出すためコストと応答時間はむしろ増え、回答の長さは正しさの基準になりません。
- D正しい。難易度に応じて使い分けることで、品質を保ちつつコストとレイテンシを下げられます。