[論文レビュー] Efficient Conformer with Prob-Sparse Attention Mechanism for End-to-EndSpeech Recognition
本稿では、エンドツーエンド音声認識における推論速度の向上とメモリ使用量の削減を目的として、Conformer Transducer モデル向けに確率スパース自己注意機構を提案する。Kullback-Leibler 散布度を用いて情報量の多いクエリのみを特定・保持することで、LibriSpeech および AISHELL-1 データセットにおいて ASR の精度を損なわずに推論速度を 8%–45% 速め、メモリ使用量を 15%–45% 減少させた。
End-to-end models are favored in automatic speech recognition (ASR) because of their simplified system structure and superior performance. Among these models, Transformer and Conformer have achieved state-of-the-art recognition accuracy in which self-attention plays a vital role in capturing important global information. However, the time and memory complexity of self-attention increases squarely with the length of the sentence. In this paper, a prob-sparse self-attention mechanism is introduced into Conformer to sparse the computing process of self-attention in order to accelerate inference speed and reduce space consumption. Specifically, we adopt a Kullback-Leibler divergence based sparsity measurement for each query to decide whether we compute the attention function on this query. By using the prob-sparse attention mechanism, we achieve impressively 8% to 45% inference speed-up and 15% to 45% memory usage reduction of the self-attention module of Conformer Transducer while maintaining the same level of error rate.
研究の動機と目的
- 長時間の音声シーケンスにおける Conformer モデルの自己注意機構に起因する高い計算コストとメモリ使用量を軽減すること。
- 情報量が低いクエリを同定・削除することで、自己注意機構における余分な計算を低減すること。
- 顕著な推論効率の向上を達成しながら、最先端の ASR 性能を維持すること。
- 層間でのスパarsity 測定の共有を検討し、追加の計算オーバーヘッドを最小限に抑えること。
提案手法
- 本手法は、Kullback-Leibler 散布度を用いてクエリのスパarsity を測定し、非一様な注意分布を持つクエリを同定する確率的スパース自己注意機構を導入する。
- 注意スコアが一様分布から著しく逸脱するクエリのみを計算に保持することで、効果的に注意行列をスパース化する。
- スパarsity の閾値はハイパーパramータ $ r_{sparse} $ によって制御され、スパarsity スコアに基づいて保持するクエリの割合が決定される。
- スパarsity 測定の共有を層間で実施し、$ N_{share} $ 層ごとに測定値を計算して再利用することで、計算量を削減する。
- 本手法は Conformer Transducer アーキテクチャに統合され、エンコーダブロック内の標準的な自己注意機構に置き換えられる。
- スパarsity と共有パラメータに関するアブレーションスタディを実施するため、LibriSpeech および AISHELL-1 データセットでモデルを訓練・評価する。

実験結果
リサーチクエスチョン
- RQ1注意分布のエントロピーに基づく学習可能なスパarsity 基準が、ASR 精度を損なわずに推論効率を向上させることができるか?
- RQ2スパarsity 閾値 $ r_{sparse} $ の選択が、認識性能と効率にどのように影響を与えるか?
- RQ3スパarsity 測定をどの程度層間で共有することで、計算オーバーヘッドを低減できるか?
- RQ4確率的スパース機構は、LibriSpeech や AISHELL-1 といった多様な音声認識ベンチマークで性能を維持できるか?
主な発見
- 確率的スパース注意機構により、Conformer Transducer モデルにおいて異なるシーケンス長で 8% から 45% の高速な推論が達成された。
- 標準的な Conformer と比較して、自己注意モジュールのメモリ使用量が 15% から 45% 減少した。
- $ r_{sparse} $ を 0.35 から 0.5 の範囲に設定した場合、AISHELL-1 および LibriSpeech データセットの両方でベースラインと同等の CER/WER を維持した。
- $ N_{share} = 4 $ のスパarsity 測定共有により、計算量が 4 倍削減され、CER に顕著な低下は認められなかった。さらに $ N_{share} = 8 $ であっても CER の増加はたった 0.1% にとどまった。
- 本手法はデータセットにかかわらず安定した改善を示し、AISHELL-1 および LibriSpeech の両方で一貫した性能向上を達成した。特に、より大きな LibriSpeech コーパスにおいても同様の効果が得られた。
- シーケンス長が延びるほど、効率的向上が顕著に現れ、特に長時間音声認識に特に有効であることがわかった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。