[论文解读] Performance-Efficiency Trade-offs in Unsupervised Pre-training for Speech Recognition
本文提出 SEW(Squeezed and Efficient Wav2vec),一种针对 wav2vec 2.0 的重新设计架构,通过优化时间分辨率、高效的特征提取以及有策略的参数分配,在提升性能的同时显著提高推理效率。SEW-D-mid 在 LibriSpeech 上实现 1.9 倍的推理加速和 13.5% 的 WER 相对降低,相较 W2V2-base;而 SEW-D-base+ 在参数量仅为 W2V2-large 一半的情况下达到相当的性能,且预训练速度提升 3.2 倍。
This paper is a study of performance-efficiency trade-offs in pre-trained models for automatic speech recognition (ASR). We focus on wav2vec 2.0, and formalize several architecture designs that influence both the model performance and its efficiency. Putting together all our observations, we introduce SEW (Squeezed and Efficient Wav2vec), a pre-trained model architecture with significant improvements along both performance and efficiency dimensions across a variety of training setups. For example, under the 100h-960h semi-supervised setup on LibriSpeech, SEW achieves a 1.9x inference speedup compared to wav2vec 2.0, with a 13.5% relative reduction in word error rate. With a similar inference time, SEW reduces word error rate by 25-50% across different model sizes.
研究动机与目标
- 分析并优化 wav2vec 2.0 在自动语音识别(ASR)预训练中的性能-效率权衡。
- 识别影响模型准确率与推理速度的关键架构组件。
- 开发一种新型模型架构,在不增加模型大小或计算成本的前提下,同时提升性能与效率。
- 通过降低推理延迟和能耗,实现预训练 ASR 模型的实际部署。
提出的方法
- 提出 SEW,一种基于 wav2vec 2.0 的新架构,通过优化表示与解码的时间分辨率。
- 设计一种轻量级波形特征提取器,相比原始 wav2vec 2.0 提取器将推理时间减少 50%。
- 通过将更多参数分配给网络深层,重新分配模型容量,在不增加下游计算量的前提下提升性能。
- 提出 SEW-D,采用解耦注意力机制,进一步提升性能与效率。
- 采用两阶段训练设置:在 960 小时未标注 LibriSpeech 数据上进行预训练,随后使用 100 小时标注数据进行微调。
- 采用 W2V2-base 的标准微调超参数,针对更大的 SEW 模型调整了初始学习率和 dropout 率以提升稳定性。

实验结果
研究问题
- RQ1调整网络的时间分辨率如何影响 wav2vec 2.0 的性能-效率权衡?
- RQ2更高效的波形特征提取器是否能在将推理时间减半的同时保持性能?
- RQ3在预训练网络中,模型容量在不同层之间的最优分配方式是什么?
- RQ4提升预测头的表达能力是否能提升性能,而不会影响下游推理?
- RQ5重新设计的架构是否能在多种 ASR 设置下,同时超越原始 wav2vec 2.0 的准确率与推理速度?
主要发现
- SEW-D-mid 在使用 100 小时标注数据的 LibriSpeech dev-other 上,实现 1.9 倍的推理加速和 13.5% 的 WER 相对降低,相较 W2V2-base。
- 在相似推理时间下,SEW 在不同模型尺寸下相较 W2V2 将 WER 降低了 25–50%。
- SEW-D-base+ 在参数量仅为 W2V2-large 一半的情况下,达到相当的词错误率,且预训练速度提升 3.2 倍。
- SEW-D-mid 在 TED-LIUM 3 和 Fisher+Switchboard 上将推理时间减少 30%,同时在所有跨域数据集上实现更低或相当的 WER。
- 在所有测试数据集(TED-LIUM 3、VoxPopuli、Fisher+Switchboard)上,SEW-D-mid 仅使用 10 小时标注数据,即优于 W2V2-base,且至少快 30%。
- 该模型实现了最先进的性能-效率权衡,使自监督 ASR 模型的部署更加迅速、经济且节能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。