過去問ドリル

AI-103:Developing AI Apps and Agents on Azure 生成 AI とエージェント ソリューションの実装 問10

生成 AI とエージェント ソリューションの実装/Foundry での生成アプリ構築

社内ナレッジを検索して回答する RAG チャット アプリで、回答が長い場合に「送信してから最初の文字が表示されるまで」の待ち時間が長く、利用者が応答なしと感じて離脱します。モデル デプロイの呼び出し方だけを変えて、体感の待ち時間を短くする方法として適切なものはどれですか。

当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「生成 AI とエージェント ソリューションの実装」に対応。実際の試験問題ではありません)

正解:A

解説

回答全体の生成完了を待たずに体感の待ち時間を短くするには、応答をストリーミングで受け取り、生成されたトークンを順次画面に表示します。最初のトークンが届いた時点で表示が始まるため、利用者は処理が進んでいることを早く認識できます。最大出力トークン数や temperature は回答の内容や長さに影響する設定で、最初の文字が出るまでの時間を直接は短縮しません。

選択肢ごとの解説

  • A正しい。ストリーミングで受け取れば、最初のトークンが生成された時点から順次表示でき、体感の待ち時間を短縮できます。
  • B誤り。最大出力トークン数を下げると回答は短くなりますが、回答の内容が削られるうえ、最初の文字が出るまでの時間は変わりません。
  • C誤り。temperature は出力のばらつきを調整する設定で、応答が返り始めるまでの時間には影響しません。
  • D誤り。バッチ処理は完成した回答をまとめて受け取る非同期処理で、対話的な用途ではかえって待ち時間が長くなります。
AI-103:Developing AI Apps and Agents on Azureの問題を演習モードで解く