[論文レビュー] Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT
本稿では、非自己回帰的でエンドツーエンドの自動音声認識モデルLASOを提案する。このモデルは、位置依存要約モジュールと、符号化された音声特徴量に対する自己注意機構を用いて、すべてのテキストトークンを並列に予測する。これにより、自己回帰的トランスフォーマーと比較して約50倍高速な推論が達成される。さらに、事前学習済みBERT言語モデルからの意味的知識を、クロスモーダル知識蒸留によって転送することで、精度が向上する。
Attention-based encoder-decoder (AED) models have achieved promising performance in speech recognition. However, because the decoder predicts text tokens (such as characters or words) in an autoregressive manner, it is difficult for an AED model to predict all tokens in parallel. This makes the inference speed relatively slow. We believe that because the encoder already captures the whole speech utterance, which has the token-level relationship implicitly, we can predict a token without explicitly autoregressive language modeling. When the prediction of a token does not rely on other tokens, the parallel prediction of all tokens in the sequence is realizable. Based on this idea, we propose a non-autoregressive speech recognition model called LASO (Listen Attentively, and Spell Once). The model consists of an encoder, a decoder, and a position dependent summarizer (PDS). The three modules are based on basic attention blocks. The encoder extracts high-level representations from the speech. The PDS uses positional encodings corresponding to tokens to convert the acoustic representations into token-level representations. The decoder further captures token-level relationships with the self-attention mechanism. At last, the probability distribution on the vocabulary is computed for each token position. Therefore, speech recognition is re-formulated as a position-wise classification problem. Further, we propose a cross-modal transfer learning method to refine semantics from a large-scale pre-trained language model BERT for improving the performance.
研究の動機と目的
- 逐次的トークン生成による自己回帰的エンドツーエンドASRモデルの推論速度の遅さを解消すること。
- ビームサーチを必要とせず、完全に並列化されたトークン予測を可能にする非自己回帰的アーキテクチャの開発。
- 事前学習済みのテキスト専用言語モデル(BERT)からの知識転送により、音声認識における意味理解を向上させること。
- 低リソースおよび長時間の発話文に対しても、高速な推論を維持しながら競争力あるASR性能を達成すること。
- クロスモーダル意味的整合性を活用することで、全発話モデルにおける未観測発話長に対する感受性を低減すること。
提案手法
- エンコーダ、位置依存要約モジュール(PDS)、デコーダを備えた、フィードフォワード型の非自己回帰モデルであるLASOを提案する。
- PDSモジュールを用いて、符号化された音声シーケンス全体に注目し、位置に応じたトークン固有の表現を生成する。
- 自己回帰的デコーディングを、並列なフィードフォワード構造に置き換えることで、ビームサーチの必要性を排除し、リアルタイム推論を可能にする。
- LASOのデコーダの意味表現と、事前学習済みBERTモデルの表現を一致させるために、クロスモーダル知識蒸留を適用する。
- LASOのデコーダの隠れ状態を、対応するBERT表現と一致させる知識蒸留損失を用いて、微調整を行う。
- ASR損失と意味的整合性損失の両方を組み合わせ、中国語の音声データセット(AISHELL-1およびAISHELL-2)上でエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1自己回帰的トランスフォーマーと比較して、精度を損なわずに著しく高速な推論が可能な非自己回帰的エンドツーエンドASRモデルは実現可能か?
- RQ2事前学習済みBERTモデルからのクロスモーダル知識蒸留は、音声認識における意味理解の向上にどの程度有効か?
- RQ3提案されたLASOモデルは、未観測の発話長に対しても十分に一般化できるか?特に自己回帰的モデルと比較して。
- RQ4BERTからの意味的精錬は、発音が正しいが意味的に誤りのある類似語(例:「一場」vs.「突如」)の誤りを是正できるか?
- RQ5BERTベースの意味的整合性は、OoV語や希少語の処理において、モデル性能にどのような影響を与えるか?
主な発見
- LASOは、トークン予測の完全な並列化のおかげで、自己回帰的トランスフォーマーに基づくASRモデルと比較して約50倍の高速な推論速度を達成する。
- モデルはAISHELL-1およびAISHELL-2データセットにおいて、最先端の自己回帰的モデルと同等の競争力あるASR性能を維持する。
- BERTからのクロスモーダル知識蒸留は、意味的正確性を顕著に向上させ、類似発音語が誤った意味を持つ場合の誤りを是正する。
- 「一場」vs.「突如」、「爺泳」vs.「おじいちゃん」、「受存」vs.「ダイエット」などの例では、発音が正しくても意味的誤りをBERTの精錬によって是正した。
- 自己回帰的モデルよりも未観測発話長に対して感受性が高くなる傾向があるが、データ拡張やVADベースのセグメンテーションによってこれを緩和できる。
- BERTの統合により、参照語が完全に一致しなくても、文法的に正しいおよび意味的に整合性のある語の選択が向上し、一般化性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。