AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問10
生成 AI とエージェント ソリューションの実装/Foundry での生成アプリ構築社内ナレッジを検索して回答する RAG チャット アプリで、回答が長い場合に「送信してから最初の文字が表示されるまで」の待ち時間が長く、利用者が応答なしと感じて離脱します。モデル デプロイの呼び出し方だけを変えて、体感の待ち時間を短くする方法として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)
- A応答をストリーミングで受け取り、生成されたトークンを順次画面に表示する
- B最大出力トークン数を小さく設定して、回答が必ず短くなるようにする
- Ctemperature を下げて、モデルが余計な文を生成しないようにする
- D要求を非同期のバッチ処理に切り替えて、回答が完成してからまとめて受け取る
正解:A
解説
回答全体の生成完了を待たずに体感の待ち時間を短くするには、応答をストリーミングで受け取り、生成されたトークンを順次画面に表示します。最初のトークンが届いた時点で表示が始まるため、利用者は処理が進んでいることを早く認識できます。最大出力トークン数や temperature は回答の内容や長さに影響する設定で、最初の文字が出るまでの時間を直接は短縮しません。
選択肢ごとの解説
- A正しい。ストリーミングで受け取れば、最初のトークンが生成された時点から順次表示でき、体感の待ち時間を短縮できます。
- B誤り。最大出力トークン数を下げると回答は短くなりますが、回答の内容が削られるうえ、最初の文字が出るまでの時間は変わりません。
- C誤り。temperature は出力のばらつきを調整する設定で、応答が返り始めるまでの時間には影響しません。
- D誤り。バッチ処理は完成した回答をまとめて受け取る非同期処理で、対話的な用途ではかえって待ち時間が長くなります。