[论文解读] HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
HuBERT-EE 通过在 HuBERT 模型的中间层插入多个轻量级分支,提出了一种用于高效语音识别的动态早停机制,当预测置信度较高时可实现早期推理。在 LibriSpeech 上,其推理速度最高提升 24%,WER 损失低于 3%,无需微调即可在速度与精度之间实现平衡。
Pre-training with self-supervised models, such as Hidden-unit BERT (HuBERT) and wav2vec 2.0, has brought significant improvements in automatic speech recognition (ASR). However, these models usually require an expensive computational cost to achieve outstanding performance, slowing down the inference speed. To improve the model efficiency, we introduce an early exit scheme for ASR, namely HuBERT-EE, that allows the model to stop the inference dynamically. In HuBERT-EE, multiple early exit branches are added at the intermediate layers. When the intermediate prediction of the early exit branch is confident, the model stops the inference, and the corresponding result can be returned early. We investigate the proper early exiting criterion and fine-tuning strategy to effectively perform early exiting. Experimental results on the LibriSpeech show that HuBERT-EE can accelerate the inference of the HuBERT while simultaneously balancing the trade-off between the performance and the latency.
研究动机与目标
- 解决大型自监督语音模型(如 HuBERT)推理延迟过高的问题,该问题限制了其在实时场景中的部署。
- 克服尽管已有量化或蒸馏等效率技术,大型架构中仍存在全模型推理效率低下的问题。
- 为自动语音识别(ASR)设计一种新颖的早停机制,尤其针对基于 CTC 的模型,其与标准分类任务存在差异。
- 在不微调主干模型的前提下,实现推理速度与识别精度之间的动态、可配置权衡。
- 优化早停分支的结构与位置,以在帧级 ASR 设置下实现性能与计算效率的最佳平衡。
提出的方法
- 在 HuBERT-large 模型的中间层(第 5、10、15、20 层)插入多个早停分支,每个分支均配备自注意力机制和线性投影以进行预测。
- 采用置信度分数与熵作为早停标准:当置信度 > 0.955 或熵 < 0.0035 时触发早停,实现帧级决策。
- 通过端到端微调联合训练早停分支与主干网络,确保与 CTC 目标对齐,以支持序列级 ASR。
- 通过调整早停分支的自注意力维度(D_EE = 512、1024、2048)来研究性能与效率之间的权衡。
- 在推理过程中动态应用早停:若某一分支的预测满足置信度或熵阈值,则立即返回结果,跳过后续层。
- 使用 dev-clean 和 test-clean 数据集评估不同阈值与分支配置下的质量-效率权衡。

实验结果
研究问题
- RQ1早停机制能否有效应用于与标准分类任务不同的基于 CTC 的自动语音识别模型?
- RQ2在像 HuBERT 这类深层 Transformer 架构的 ASR 模型中,早停分支的最优位置与复杂度是什么?
- RQ3在 LibriSpeech 上,基于置信度与基于熵的早停标准在推理加速与 WER 表现方面如何比较?
- RQ4HuBERT-EE 能在多大程度上加速推理,同时保持与完整 HuBERT-large 模型相当的 WER 表现?
- RQ5模型是否能通过可配置的早停阈值实现无需微调的动态速度-精度权衡?
主要发现
- HuBERT-EE 在 dev-clean 数据集上实现了最高 24% 的推理加速,WER 仅增加 0.93%(从 2.02% 上升至 2.95%),展现出显著的效率提升。
- 在大多数情况下,基于熵的早停标准(阈值 < 0.0035)优于基于置信度的标准(阈值 > 0.955),尤其在 dev-clean 和 test-clean 上表现更优,实现更快的推理与更低的 WER。
- 位于更深层的早停分支(如第 20 层)达到的 WER 与完整 HuBERT 模型相当(2.02%),而浅层分支性能显著更差。
- 早停分支的自注意力维度 D_EE = 1024 时实现了最佳的质量-效率权衡;而 D_EE = 2048 导致性能下降(WER 2.97%)甚至出现负向加速(-0.24%),表明收益递减。
- 模型在所有数据集上均保持了具有竞争力的 WER,dev-clean 与 test-clean 的 WER 降幅均低于 3%,并通过阈值调节展现出在速度与精度之间灵活调整的能力。
- 该方法实现了无需微调的动态、运行时可配置推理速度,适用于资源约束多变的真实场景部署。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。