[論文レビュー] Efficient conformer-based speech recognition with linear attention
本論文では、線形自己注意機構を用いたコンフォーマー(LAC)を提案する。LACは、計算コストが線形時間に削減された軽量で効率的な自動音声認識モデルであり、コンフォーマーの二次的計算量を要する自己注意機構を、マルチヘッド線形自己注意(MHLSA)に置き換える。性能を維持しつつ、計算コストを線形時間に削減する。さらに、前向き伝播ネットワークに低ランク因子分解を適用し、パラメータ数を約50%削減しながら精度の低下を最小限に抑える。LACは、LibriSpeechのdev-cleanで2.1%、test-otherで2.3%の優れたWERを達成し、パラメータ数は50%減少、トレーニング速度は1.23倍速くなった。
Recently, conformer-based end-to-end automatic speech recognition, which outperforms recurrent neural network based ones, has received much attention. Although the parallel computing of conformer is more efficient than recurrent neural networks, the computational complexity of its dot-product self-attention is quadratic with respect to the length of the input feature. To reduce the computational complexity of the self-attention layer, we propose multi-head linear self-attention for the self-attention layer, which reduces its computational complexity to linear order. In addition, we propose to factorize the feed forward module of the conformer by low-rank matrix factorization, which successfully reduces the number of the parameters by approximate 50% with little performance loss. The proposed model, named linear attention based conformer (LAC), can be trained and inferenced jointly with the connectionist temporal classification objective, which further improves the performance of LAC. To evaluate the effectiveness of LAC, we conduct experiments on the AISHELL-1 and LibriSpeech corpora. Results show that the proposed LAC achieves better performance than 7 recently proposed speech recognition models, and is competitive with the state-of-the-art conformer. Meanwhile, the proposed LAC has a number of parameters of only 50% over the conformer with faster training speed than the latter.
研究の動機と目的
- エンドツーエンド音声認識におけるコンフォーマーの自己注意機構の二次的計算量を低減すること。
- 性能の著しい低下を伴わずにモデルサイズとトレーニングコストを削減すること。
- 低リソース環境やリアルタイムデプロイメントに適した、コンフォーマー基盤のASRシステムの効率性とスケーラビリティを向上させること。
- 音声認識の系列モデリングにおいて、マルチヘッド線形自己注意と低ランク因子分解の有効性を検証すること。
提案手法
- ドット積自己注意の線形時間代替としてのマルチヘッド線形自己注意(MHLSA)を提案し、相関行列の計算を回避する。
- エンコーダーおよびデコーダーの両方の前向き伝播ネットワークに低ランク行列因子分解を適用し、パラメータ数を約50%削減する。
- ASR性能の向上を目的に、共同学習および推論時に接続主義的時系列分類(CTC)損失を統合する。
- 入力系列長を短縮するために、サブサンプリング付きのCNNフロントエンドを用い、その後にスタックされたLACエンコーダーおよびデコーダーを配置する。
- MHLSAモジュールで相対的位置エンコーディングを採用し、系列順序情報の保持を図る。
- CTCを共同でトレーニングおよびデコードに用いることで、アライメントの精度とモデルのロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ1マルチヘッド線形自己注意は、線形時間計算量と同等の性能を達成しながら、ドット積自己注意を効果的に置き換えられるか?
- RQ2低ランク因子分解は、ASR精度に著しい悪影響を与えることなく、コンフォーマーのパラメータ数をどの程度まで削減できるか?
- RQ3共同CTCトレーニングは、線形自己注意に基づくコンフォーマー・モデルの性能を向上させるか?
- RQ4最先端のコンフォーマーおよび最近の他のASRモデルと比較して、提案されたLACモデルは精度、速度、パラメータ効率の点でどの程度優れているか?
主な発見
- AISHELL-1のテストセットにおいて、LACは文字誤り率(CER)5.02%を達成し、7つの最近のモデルを上回り、コンフォーマーの4.88%に近づいた。
- LibriSpeechでは、dev-cleanでWER 2.1%、test-otherで2.3%を達成し、完全なコンフォーマーと同等の性能を示した。
- AISHELL-1では2283万パラメータ、LibriSpeechでは2347万パラメータを有し、コンフォーマーと比較して約50%のパラメータ削減を達成した。
- AISHELL-1では1.23倍、LibriSpeechでは1.18倍の高速なトレーニングを実現した。これは、線形自己注意とパラメータ数の削減によるものである。
- アブレーションスタディの結果、MHLSAは計算量をO(T²)からO(T)に削減しながら性能を維持しており、低ランク因子分解はパラメータ数を約50%削減しながら精度の低下を最小限に抑えることが確認された。
- AISHELL-1において、ボトルネック次元(d_bn)が100の設定が、モデルサイズと性能の最良のトレードオフを示し、devでCER 4.73%、testでCER 5.02%を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。