Skip to main content
QUICK REVIEW

[論文レビュー] Non-autoregressive Transformer-based End-to-end ASR using BERT

Fu-Hao Yu, Kuan-Yu Chen|arXiv (Cornell University)|Apr 10, 2021
Speech Recognition and Synthesis参考文献 30被引用数 13
ひとこと要約

本論文は、文脈表現学習の向上を図るために、事前学習済み言語モデルとしてのBERTを活用する非自己回帰的Transformerベースのエンドツーエンド自動音声認識(ASR)モデルを提案する。音声特徴量上でBERTを微調整することで、AISHELL-1データセットにおいて競争的または優れた性能を達成し、高速な推論と高いASR精度を両立する。

ABSTRACT

Transformer-based models have led to significant innovation in classical and practical subjects as varied as speech processing, natural language processing, and computer vision. On top of the Transformer, attention-based end-to-end automatic speech recognition (ASR) models have recently become popular. Specifically, non-autoregressive modeling, which boasts fast inference and performance comparable to conventional autoregressive methods, is an emerging research topic. In the context of natural language processing, the bidirectional encoder representations from Transformers (BERT) model has received widespread attention, partially due to its ability to infer contextualized word representations and to enable superior performance for downstream tasks while needing only simple fine-tuning. Motivated by the success, we intend to view speech recognition as a downstream task of BERT, thus an ASR system is expected to be deduced by performing fine-tuning. Consequently, to not only inherit the advantages of non-autoregressive ASR models but also enjoy the benefits of a pre-trained language model (e.g., BERT), we propose a non-autoregressive Transformer-based end-to-end ASR model based on BERT. We conduct a series of experiments on the AISHELL-1 dataset that demonstrate competitive or superior results for the model when compared to state-of-the-art ASR systems.

研究の動機と目的

  • 非自己回帰的ASRモデルの利点(高速な推論)とBERTの文脈表現力の強みを統合すること。
  • エンドツーエンドASRをBERTの下流タスクとして扱い、音声入力に対して効果的な微調整を可能にすること。
  • 自己回帰的デコードを必要とせずに、事前学習済みBERT表現を活用してASR性能を向上させること。
  • 最小限のアーキテクチャ変更で、BERTベースのモデリングを音声認識に効果的に適応できることを示すこと。
  • AISHELL-1ベンチマークにおいて、最先端のASRシステムと比較して競争的または優れた結果を達成すること。

提案手法

  • 生のまたは抽出された音声特徴量を入力トークンとして処理できるように、BERTの双方向トランスフォーマーエンコーダーを変更する。
  • 非自己回帰的デコード戦略を用いて、音声認識タスクで事前学習済みBERTモデルを微調整する。
  • 標準的なマスク言語モデルヘッドをASRに特化したシーケンス・ツー・シーケンスヘッドに置き換える。
  • すべての出力トークンを並列に生成する非自己回帰的トランスフォーマー・デコーダーを採用し、推論速度を向上させる。
  • 非自己回帰設定における学習の安定化を図るために、知識蒸留またはトークンアライメント技術を適用する。
  • BERTの深層部における文脈化された表現を活用し、音声から単語へのアライメントと転写精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的デコードを必要とせずに、BERTの事前学習済み文脈表現をエンドツーエンドASRに効果的に転送できるか?
  • RQ2自己回帰的および非自己回帰的ベースラインと比較して、非自己回帰的BERTベースのASRモデルの精度と推論速度はどのように異なるか?
  • RQ3音声特徴量上でBERTを微調整することで、ASRにおけるシーケンス・ツー・シーケンスモデリングにどのような影響を与えるか?
  • RQ4BERTの双方向的文脈を活用することで、AISHELL-1のような低リソース音声データセットにおけるASR性能が向上するか?
  • RQ5非自己回帰的設計は、自己回帰モデルと比較して推論時間を著しく短縮しつつ、高い精度を維持できるか?

主な発見

  • 提案された非自己回帰的BERTベースのASRモデルは、AISHELL-1データセットにおいて、最先端のシステムと比較して競争的または優れた単語誤り率(WER)性能を達成した。
  • 並列デコードにより、推論速度が著しく向上したが、転写精度に悪影響を与えることなく実現された。
  • 音声特徴量上でBERTを微調整することで、文脈的な言語知識が効果的に転送され、アライメント精度と耐障害性が向上した。
  • BERTの双方向アテンションメカニズムの統合により、音声シーケンスにおける長距離依存関係のモデリングが強化された。
  • 微調整データが限られた状況でも強力な結果が得られたことから、事前学習による優れた一般化能力が示された。
  • 推論時間は自己回帰モデルと比較して桁違いに短縮された一方で、WER性能は自己回帰ベースラインと同等または上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。