[论文解读] Distilling Knowledge from Ensembles of Acoustic Models for Joint CTC-Attention End-to-End Speech Recognition
本论文提出了三种基于错误率(ER)的蒸馏策略,用于联合 CTC-attention 端到端自动语音识别(ASR)系统,利用声学模型集成来提升学生模型性能,通过优先考虑转录质量而非仅损失值来选择教师模型。这些方法在 TIMIT 上实现了 13.11% 的最先进词错误率(WER),在 Common Voice 意大利语数据集上达到 15.57%,在 Common Voice 法语数据集上达到 17.04%,优于单个教师模型和标准蒸馏基线。
Knowledge distillation has been widely used to compress existing deep learning models while preserving the performance on a wide range of applications. In the specific context of Automatic Speech Recognition (ASR), distillation from ensembles of acoustic models has recently shown promising results in increasing recognition performance. In this paper, we propose an extension of multi-teacher distillation methods to joint CTC-attention end-to-end ASR systems. We also introduce three novel distillation strategies. The core intuition behind them is to integrate the error rate metric to the teacher selection rather than solely focusing on the observed losses. In this way, we directly distill and optimize the student toward the relevant metric for speech recognition. We evaluate these strategies under a selection of training procedures on different datasets (TIMIT, Librispeech, Common Voice) and various languages (English, French, Italian). In particular, state-of-the-art error rates are reported on the Common Voice French, Italian and TIMIT datasets.
研究动机与目标
- 通过利用预训练声学模型的集成进行知识蒸馏,提升端到端 ASR 性能。
- 解决标准蒸馏方法仅依赖损失值选择教师模型的局限性,避免选择表现较差的教师。
- 直接优化学生模型以提升转录质量(以 WER 衡量),而非仅最小化损失。
- 探索并验证新型蒸馏策略,动态加权或选择教师模型,基于序列级错误率。
- 证明通过基于错误率的蒸馏复用已训练好的模型,可最小化计算资源浪费并提升性能。
提出的方法
- 提出一种用于联合 CTC-attention ASR 系统的多教师蒸馏框架,软目标来自多个教师模型。
- 提出“加权”策略,根据教师模型在小批量数据上的平均 WER 动态分配训练权重。
- 提出“Top-1”策略,学生在每个小批量中仅选择单个表现最佳的教师模型,基于句子级 WER。
- 提出“Top-k”策略,允许学生从一组表现相近的教师模型中学习,提升标签多样性。
- 使用学生模型的损失来最小化其预测与所选教师模型提供的软目标之间的交叉熵。
- 采用联合 CTC-attention 训练目标,学生通过蒸馏目标最小化 CTC 和基于注意力的交叉熵损失。

实验结果
研究问题
- RQ1从声学模型集成中进行知识蒸馏,是否能将联合 CTC-attention 端到端 ASR 系统的 WER 提升至超过单个教师模型的水平?
- RQ2与仅依赖损失值选择教师相比,基于错误率(WER)选择教师是否能带来更好的泛化能力并降低学生模型的 WER?
- RQ3不同的教师选择策略——“加权”、“Top-1”和“Top-k”——在不同数据集上如何影响最终 WER 和训练稳定性?
- RQ4基于错误率的蒸馏是否能有效利用已训练好的模型而无需重新训练,从而在减少计算浪费的同时提升性能?
- RQ5教师输出的多样性,特别是转录错误方面,如何影响学生模型的鲁棒性和准确性?
主要发现
- 所提出的基于错误率的蒸馏策略显著优于标准蒸馏基线,在四个数据集上的平均 WER 降低了 0.74%,优于最佳单个教师模型。
- 在 Common Voice 法语数据集上,该方法实现了 17.04% 的最先进 WER,超越了先前结果。
- 在 Common Voice 意大利语数据集上,该方法实现了 15.57% 的最先进 WER,证明了其在多语言场景下的强泛化能力。
- 在 TIMIT 数据集上,该方法实现了 13.11% 的最先进 WER,证实了其在标准基准上的有效性。
- “Top-k”和“加权”策略在 Librispeech 上的性能几乎完全相同(WER 差异为 1.04%),验证了错误率作为蒸馏质量代理的稳健性。
- “平均”基线(对所有教师赋予相等权重)表现始终较差,证明当包含表现差的教师时,简单的模型集成平均方法是无效的。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。