Skip to main content
QUICK REVIEW

[論文レビュー] HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition

Ji Won Yoon, Beom Jun Woo|arXiv (Cornell University)|Apr 13, 2022
Speech Recognition and Synthesis被引用数 7
ひとこと要約

HuBERT-EE は、HuBERT モデルの中間層に複数の軽量ブランチを挿入することで、予測の信頼性が高くなると早期に推論を終了する動的早期終了メカニズムを提案する。LibriSpeech では、再訓練を伴わずに、3% 未満の WER 増加で最大 24% の推論速度向上を達成し、速度と精度のバランスを取る。

ABSTRACT

Pre-training with self-supervised models, such as Hidden-unit BERT (HuBERT) and wav2vec 2.0, has brought significant improvements in automatic speech recognition (ASR). However, these models usually require an expensive computational cost to achieve outstanding performance, slowing down the inference speed. To improve the model efficiency, we introduce an early exit scheme for ASR, namely HuBERT-EE, that allows the model to stop the inference dynamically. In HuBERT-EE, multiple early exit branches are added at the intermediate layers. When the intermediate prediction of the early exit branch is confident, the model stops the inference, and the corresponding result can be returned early. We investigate the proper early exiting criterion and fine-tuning strategy to effectively perform early exiting. Experimental results on the LibriSpeech show that HuBERT-EE can accelerate the inference of the HuBERT while simultaneously balancing the trade-off between the performance and the latency.

研究の動機と目的

  • 大規模な自己教師付き音声モデル(例:HuBERT)の高い推論遅延を解消し、リアルタイムでの導入を可能にする。
  • 量子化や distillation などの既存の効率化技術にもかかわらず、大規模アーキテクチャにおけるフルモデル推論の非効率性を克服する。
  • 自動音声認識(ASR)に特化した、特に CTC ベースのモデルを想定した新しい早期終了メカニズムを設計する。
  • バックボーンモデルの再訓練を伴わずに、推論速度と認識精度の間で動的かつ設定可能なトレードオフを実現する。
  • フレーム単位の ASR フレームワークにおいて、性能と計算効率のバランスを取るために、早期終了ブランチの構造と配置を最適化する。

提案手法

  • HuBERT-large モデルの中間層(第5層、第10層、第15層、第20層)に複数の早期終了ブランチを挿入し、それぞれに自己注意機構と線形投影を備える。
  • 信頼度スコアとエントロピーを早期終了の基準として使用:信頼度 > 0.955 または エントロピー < 0.0035 の場合に早期終了を実行し、フレーム単位での意思決定を可能にする。
  • バックボーンと併せて端末から端末への微調整により、早期終了ブランチを同時に学習させ、シーケンスレベルの ASR を目的とする CTC 目的関数と整合性を保つ。
  • 早期終了ブランチの複雑さを、自己注意の次元(D_EE = 512, 1024, 2048)を変更することで調整し、性能と効率のトレードオフを調査する。
  • 推論時に動的に早期終了を適用:ブランチの予測が信頼度またはエントロピーの閾値を満たすと、残りの層をスキップして即座に結果を出力する。
  • 異なる閾値とブランチ構成における品質-効率トレードオフを評価するために、dev-clean および test-clean データセットを用いる。
(b) Proposed approach
(b) Proposed approach

実験結果

リサーチクエスチョン

  • RQ1CTC ベースの自動音声認識モデルには、標準的な分類タスクとは異なる点を考慮して、早期終了を効果的に適用できるか?
  • RQ2HuBERT のような深層 Transformer ベースの ASR モデルにおいて、早期終了ブランチの最適な配置と複雑さは何か?
  • RQ3LibriSpeech における推論速度向上と WER 性能の観点から、信頼度ベースとエントロピー基地の両基準はどのように比較されるか?
  • RQ4HuBERT-EE は、フルの HuBERT-large モデルと比較して、どれほど推論を高速化できるか?また、競争力のある WER を維持できるか?
  • RQ5再訓練を伴わず、設定可能な終了閾値に基づいて、モデルが推論速度と精度のトレードオフをランタイムで調整できるか?

主な発見

  • HuBERT-EE は dev-clean データセットで最大 24% の推論速度向上を達成し、WER は 2.02% から 2.95% に 0.93% 増加するにとどまり、顕著な効率性の向上を示した。
  • エントロピー基準(閾値 < 0.0035)は信頼度基準(閾値 > 0.955)を上回り、特に dev-clean および test-clean でより速い推論とより良い WER を達成した。
  • 深い層(例:第20層)に配置された早期終了ブランチは、フル HuBERT モデルと同等の WER(2.02%)を達成したが、浅い層のブランチは顕著に性能が劣った。
  • 早期終了ブランチにおける自己注意の次元 D_EE = 1024 が、品質-効率トレードオフにおいて最良の結果を示した。一方、D_EE = 2048 では WER が 2.97% に悪化し、逆に -0.24% の速度低下(負のスピードアップ)を示し、限界効果の減少が確認された。
  • 全データセットで競争力ある WER を維持しており、dev-clean および test-clean では 3% 未満の低下に抑えられ、閾値のチューニングにより速度と精度の調整が柔軟に可能であることが示された。
  • 本手法により、再訓練を伴わず、ランタイムで設定可能な推論速度が実現可能であり、リソース制約が変動する実世界の展開に適している。
Figure 2: Comparison of each early exit’s WER (%) and its certainty, including the confidence and the entropy. To better understand the behaviour, we varied the self-attention dimension $D_{EE}$ of the early exit branch from 512 to 2048. All the values were measured on LibriSpeech dev-clean dataset.
Figure 2: Comparison of each early exit’s WER (%) and its certainty, including the confidence and the entropy. To better understand the behaviour, we varied the self-attention dimension $D_{EE}$ of the early exit branch from 512 to 2048. All the values were measured on LibriSpeech dev-clean dataset.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。