[論文レビュー] Phoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models
本稿では、語彙外の外国固有名の認識を向上させるために、ワードピeceと音素の両方を用いたハイブリッドエンドツーエンドASRモデルを提案する。特に、低リソース言語の地理的固有名に対して有効である。音素レベルでの文脈的バイアス化を、外国語の音素を英語音素にマッピングすることで実現し、グラフムのみのバイアス化と比較して16%相対的WER低下、ワードピeceのみのバイアス化と比較して8%の低下を達成。一般英語タスクへの影響は最小限に抑えられる。
Contextual automatic speech recognition, i.e., biasing recognition towards a given context (e.g. user's playlists, or contacts), is challenging in end-to-end (E2E) models. Such models maintain a limited number of candidates during beam-search decoding, and have been found to recognize rare named entities poorly. The problem is exacerbated when biasing towards proper nouns in foreign languages, e.g., geographic location names, which are virtually unseen in training and are thus out-of-vocabulary (OOV). While grapheme or wordpiece E2E models might have a difficult time spelling OOV words, phonemes are more acoustically salient and past work has shown that E2E phoneme models can better predict such words. In this work, we propose an E2E model containing both English wordpieces and phonemes in the modeling space, and perform contextual biasing of foreign words at the phoneme level by mapping pronunciations of foreign words into similar English phonemes. In experimental evaluations, we find that the proposed approach performs 16% better than a grapheme-only biasing model, and 8% better than a wordpiece-only biasing model on a foreign place name recognition task, with only slight degradation on regular English tasks.
研究の動機と目的
- エンドツーエンド音声認識において、語彙外(OOV)の外国固有名、特に低リソース言語の地理的固有名の認識課題に対処すること。
- 音素をモデリング単位として用いることで、希少または未学習の語に特化した音響的に顕著で頑健な文脈的バイアス化を向上させること。
- ワードピeceと音素を組み合わせたハイブリッドモデリング空間を設計し、一般英語タスクのパフォーマンスを維持しながら、外国語の認識を強化すること。
- 外国語の音素からターゲット言語の音素にマッピングされた音素レベルのFSTを用いることで、再訓練なしにスケーラブルなクロスリンガルバイアス化を可能にすること。
提案手法
- モデルは、RNN-Tアーキテクチャにワードピece-音素の統合モデリング空間を採用し、言語特異的バイアスを避けるために米国英語データのみで訓練する。
- 希少な外国語の語を音素にトークン化するための語頻度ベースのサンプリング戦略を導入し、耐性を高め、精度の低下を軽減する。
- 推論時、まず外国語の語をその母国語の音素にトークン化し、事前研究で得られたマッピングを用いて類似した英語音素に変換することで、音素レベルのFSTを構築する。
- バイアス化FSTは英語音素シーケンスを入力とし、外国語を出力することで、モデルを変更せずにビームサーチが音声的に妥当な外国語名を優先できるようにする。
- ワードピeceレベルと音素レベルの両方のバイアス化FSTを並列に使用し、共有重みを採用することで、両単位の利点を補完的に活用する。
- シャロウフュージョンを用い、文脈的FSTによるスコア再評価を通じて、モデル確率とバイアススコアを重み付き組み合わせで統合する。
実験結果
リサーチクエスチョン
- RQ1グラフムまたはワードピeceレベルのバイアス化と比較して、音素レベルの文脈的バイアス化は、エンドツーエンドASRモデルにおける語彙外の外国固有名の認識を向上させることができるか?
- RQ2モデリング空間にワードピieceと音素を組み合わせることで、OOVの外国語と一般英語音声認識タスクの両方のパフォーマンスにどのような影響を与えるか?
- RQ3バイアス化語の数を増やすと、特に外国語の地名における音声的類似性によって、認識精度にどのような影響が生じるか?
- RQ4音素ベースのバイアス化は、クロスリンガル環境下で言語特異的言語モデルや外部リスコアリングコンponentの必要性を減らすことができるか?
- RQ5単一の英語で訓練されたモデルが、再トレーニングなしに音素マッピングを用いて複数の言語からの外国語を効果的に認識できるか?
主な発見
- 提案されたワードピiece-音素モデルは、フランス語の地名認識タスクにおいて、グラフムのみのバイアス化モデルと比較して16%相対的WER低下を達成した。
- ワードピeceのみのバイアス化ベースラインと比較して8%の相対的WER改善を達成し、OOV語に対する音素レベルバイアス化の有効性を示した。
- 音素レベルバイアス化にワードピieceレベルバイアス化を追加することで、さらに2%相対的WER低下が得られ、両手法が相補的であることを示した。
- バイアス化を無効化した場合、一般英語発話において僅か0.1%の絶対的WER増加にとどまり、標準タスクへの悪影響は最小限であることが示された。
- バイアス化語の数が増えると、接頭語の音声的類似性によってWERが急激に上昇し、カバレッジと混同のトレードオフが顕著になった。
- 音素マッピング戦略により、モデルの再トレーニングなしに他の外国語に対しても直接適用可能であり、スケーラブルなクロスリンガル展開を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。