AI-103:Developing AI Apps and Agents on Azure テキスト分析ソリューションの実装 問2
テキスト分析ソリューションの実装/音声ソリューション製造業のコールセンターで、通話のリアルタイム文字起こしに Azure Speech を使っています。数十種類ある製品型番(英数字の組み合わせ)が誤認識されることが多く、型番の一覧はテキストで手元にあります。録音と正解テキストの組はなく、モデルの学習やデプロイは避けたい状況です。対応として適切なものはどれですか。
当サイトのオリジナル問題(AI-103:Developing AI Apps and Agents on Azureの出題範囲「テキスト分析ソリューションの実装」に対応。実際の試験問題ではありません)
- A音声合成の SSML で発音辞書(レキシコン)を指定し、型番の読み方を定義する
- B声優に型番を読み上げてもらった音声を収録し、カスタム音声(custom voice)を作成する
- CAzure Language のカスタム固有表現抽出を学習し、認識後のテキストから型番を補正する
- D音声認識の際に、型番の一覧をフレーズリストとして指定して認識を補助する
正解:D
解説
特定の語句が誤認識される場合、手元の語句一覧をフレーズリストとして音声認識時に指定すると、それらの語句が認識されやすくなります。モデルの学習やデプロイが不要で、数十語程度の補強に向いています。なお、語句数が多い場合や音声データを用いた本格的な調整が必要な場合は、カスタム音声認識(custom speech)を検討します。また、保存済み録音のバッチ文字起こしではフレーズリストは利用できません。
選択肢ごとの解説
- A誤り。SSML の発音辞書は音声合成(読み上げ)側の設定で、音声認識の精度には影響しません。
- B誤り。カスタム音声は読み上げ用の声を作る機能で、認識の精度向上には使えません。
- C誤り。カスタム固有表現抽出はテキスト分析で、音声認識の誤りを直す機能ではなく、ラベル付きの学習データも必要です。
- D正しい。フレーズリストなら、テキストの一覧だけで学習不要のまま型番の認識を補助できます。