[论文解读] Input Length Matters: Improving RNN-T and MWER Training for Long-form Telephony Speech Recognition
本论文表明,在较长输入片段上端到端训练 RNN-T 模型可显著提升长时电话语音识别的词错误率(WER),在使用对数损失时平均降低 15.7%,在使用 MWER 损失时降低 8.8%。论文提出一种两阶段训练方案——首先在长片段上使用对数损失进行预训练,然后在原始未分割片段上使用 MWER 进行微调——仅需 4.8 小时的 MWER 训练即可实现接近最优的 WER,相比在长片段上进行完整 MWER 训练,计算成本降低了 4 倍。
End-to-end models have achieved state-of-the-art results on several automatic speech recognition tasks. However, they perform poorly when evaluated on long-form data, e.g., minutes long conversational telephony audio. One reason the model fails on long-form speech is that it has only seen short utterances during training. In this paper we study the effect of training utterance length on the word error rate (WER) for RNN-transducer (RNN-T) model. We compare two widely used training objectives, log loss (or RNN-T loss) and minimum word error rate (MWER) loss. We conduct experiments on telephony datasets in four languages. Our experiments show that for both losses, the WER on long-form speech reduces substantially as the training utterance length increases. The average relative WER gain is 15.7% for log loss and 8.8% for MWER loss. When training on short utterances, MWER loss leads to a lower WER than the log loss. Such difference between the two losses diminishes when the input length increases.
研究动机与目标
- 研究训练语音样本长度对 RNN-T 模型在长时电话语音识别中性能的影响。
- 比较对数损失和 MWER 损失在处理长时输入时的有效性。
- 通过利用更长的训练序列,在不进行分割的情况下降低长时音频的 WER。
- 开发一种计算高效的训练方案,结合对数损失和 MWER 损失的优势。
- 减少模型在长时、嘈杂电话录音上的暴露偏差,提升泛化能力。
提出的方法
- 作者将 RNN-T 模型在不同长度的训练数据上进行训练——从短语音样本到完整对话,保留非语音段落和多说话人内容。
- 他们对比了两种训练目标:标准对数损失(RNN-T 损失)和最小词错误率(MWER)损失,后者直接优化测试指标。
- 在 MWER 训练中,他们使用束搜索生成 N 个最佳假设,并基于这些候选近似计算期望词错误率。
- 他们提出一种两阶段训练方案:首先在长片段上使用对数损失进行预训练,然后在原始未分割数据上使用 MWER 损失进行微调。
- 他们实验了对完整模型和仅解码器(预测和联合网络)进行微调,同时在 MWER 目标中使用较小的 λ 值。
- 他们在四个语言的电话语音数据集上进行评估,包括域内和域外测试集,测量 WER 和计算成本。
实验结果
研究问题
- RQ1增加训练语音样本长度是否能提升 RNN-T 模型在长时电话语音识别中的性能?
- RQ2在长输入上训练时,对数损失和 MWER 损失在 WER 降低方面有何差异?
- RQ3能否使 MWER 损失在长时语音识别中计算上可行,同时不牺牲性能?
- RQ4结合对数损失和 MWER 损失的两阶段训练方案是否能在更低训练成本下获得更好的 WER?
- RQ5当训练数据包含更长上下文时,模型在长时数据上的泛化能力如何变化?
主要发现
- 在四种语言上,使用对数损失时,训练语音样本长度增加使 WER 平均降低 15.7%;使用 MWER 损失时,平均降低 8.8%。
- 随着训练输入长度的增加,MWER 与对数损失之间的性能差距缩小,表明更长的输入减少了 MWER 的优势。
- 在西班牙语长时测试集上,两种损失函数的 WER 均随训练片段变长而持续改善。
- 两阶段训练方案——先在长片段上使用对数损失预训练,再在原始片段上使用 MWER 微调——实现的 WER 接近或优于完整 MWER 训练。
- 仅对解码器进行 MWER 微调可将总训练时间缩短至 4.8 小时,相比在长片段上进行完整 MWER 训练,计算成本降低 4 倍。
- 两阶段方法在域内和域外电话语音测试集上均达到当前最优 WER,且相比端到端 MWER 训练,计算成本显著降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。