AI-103:Developing AI Apps and Agents on Azure Azure AI ソリューションの計画と管理 問10
Azure AI ソリューションの計画と管理/AI システムの管理・監視・セキュリティある企業の Microsoft Foundry で、1つのモデルのデプロイを複数の事業部のアプリが共有しています。特定の事業部のアプリが大量に呼び出すと他部門の処理が遅くなるため、事業部ごとに1分あたりのトークン数の上限を設けて超過分を拒否し、あわせて事業部ごとのトークン消費量を計測したいと考えています。モデルのデプロイは共有のままにします。構成として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「Azure AI ソリューションの計画と管理」に対応。実際の試験問題ではありません)
- AFoundry の前段に Azure API Management を配置し、事業部ごとのサブスクリプションに対してトークン制限のポリシーとトークン消費量を記録するポリシーを適用する
- BAzure Cost Management で事業部ごとのタグを設定して予算を作成し、予算の超過を通知するアラートを構成する
- C共有しているモデルのデプロイの1分あたりのトークン数(TPM)の割り当てを引き下げ、全アプリに一律の上限を適用する
- D事業部ごとに Foundry の API キーを発行して配布し、消費量が多い事業部のキーを管理者が必要に応じて再生成して利用を止める
正解:A
解説
Azure API Management を AI ゲートウェイとして Foundry の前段に置くと、サブスクリプションや呼び出し元ごとにトークン数の制限(llm-token-limit ポリシー)を適用し、超過した要求を拒否できます。トークン消費量の記録(llm-emit-token-metric ポリシー)で、事業部ごとの使用量を Application Insights(Azure Monitor)などで集計することもできます。デプロイ側の TPM は全呼び出し元に共通の上限であり、事業部ごとの制御はできません。
選択肢ごとの解説
- A正しい。API Management のトークン制限ポリシーで事業部ごとの上限を超過した要求を拒否でき、消費量の記録のポリシーで事業部ごとの計測もできます。
- B誤り。Cost Management の予算とアラートは、課金額の超過を通知する仕組みです。1分あたりのトークン数での拒否はできず、他部門への影響の抑制にもなりません。
- C誤り。デプロイの TPM は共有デプロイ全体への上限で、全アプリに共通です。事業部ごとの上限や計測にはならず、引き下げると全部門が影響を受けます。
- D誤り。キーの再生成は利用を止める手動の操作で、トークン数の上限を自動で適用する仕組みではありません。事業部ごとの計測もできず、運用の負担も大きくなります。