[论文解读] RNN-T Models Fail to Generalize to Out-of-Domain Audio: Causes and Solutions
本文将RNN-T模型在域外及长音频上泛化能力差的主要原因归因于编码器过拟合。提出了一种结合频谱增强(SpecAugment)、变分噪声和随机段落扰动的正则化组合策略,并引入动态重叠推理(DOI),在YouTube长音频上实现33.6%的相对WER改进,在搜索数据上实现62%的改进,DOI还将基于Librispeech训练的模型在WER上从99.8%降低至33.0%。
In recent years, all-neural end-to-end approaches have obtained state-of-the-art results on several challenging automatic speech recognition (ASR) tasks. However, most existing works focus on building ASR models where train and test data are drawn from the same domain. This results in poor generalization characteristics on mismatched-domains: e.g., end-to-end models trained on short segments perform poorly when evaluated on longer utterances. In this work, we analyze the generalization properties of streaming and non-streaming recurrent neural network transducer (RNN-T) based end-to-end models in order to identify model components that negatively affect generalization performance. We propose two solutions: combining multiple regularization techniques during training, and using dynamic overlapping inference. On a long-form YouTube test set, when the nonstreaming RNN-T model is trained with shorter segments of data, the proposed combination improves word error rate (WER) from 22.3% to 14.8%; when the streaming RNN-T model trained on short Search queries, the proposed techniques improve WER on the YouTube set from 67.0% to 25.3%. Finally, when trained on Librispeech, we find that dynamic overlapping inference improves WER on YouTube from 99.8% to 33.0%.
研究动机与目标
- 诊断为何在短时域内数据上训练的RNN-T模型在长音频和域外音频上泛化能力差,特别是当训练数据为短时域内数据时。
- 识别在域不匹配条件下,流式与非流式RNN-T模型性能下降的根本原因。
- 开发并评估无需域匹配训练数据的正则化技术,以提升泛化能力。
- 提出动态重叠推理(DOI)作为严重域不匹配情况下模型的鲁棒推理时解决方案,尤其在正则化效果不足时。
提出的方法
- 作者分析了RNN-T各组件,识别出编码器最易发生过拟合,导致在域外输入上产生过多空白预测和高删除率。
- 提出一种正则化组合策略,结合频谱增强(时间与频率掩蔽)、变分噪声(类似随机丢弃的噪声)和随机段落扰动(RSP),以提升训练过程中的鲁棒性。
- 在推理阶段,提出动态重叠推理(DOI),通过处理长音频的重叠片段并合并假设,减少误差传播并提升长序列建模能力。
- DOI采用滑动窗口机制(例如16秒窗口,2秒重叠),并动态调整假设对齐,以最小化删除与替换错误。
- 在三种设置下评估该方法:YouTube短音频、搜索查询和基于Librispeech训练的模型,WER在YouTube长音频测试集上进行测量。
- 作者对比了基线模型、单一正则化方法与组合正则化方法的性能,并评估了DOI在存在大域差距模型上的有效性。
![Fig. 1 : Block diagram of an RNN-T model [ 22 , 13 ] .](https://ar5iv.labs.arxiv.org/html/2005.03271/assets/x1.png)
实验结果
研究问题
- RQ1为何在短时域内数据上训练的RNN-T模型在YouTube视频等长音频、域外音频上泛化能力差?
- RQ2RNN-T架构中哪个组件在域不匹配条件下最易导致过拟合和泛化能力下降?
- RQ3结合多种正则化技术是否能在不重新训练的情况下提升域外音频上的泛化性能?
- RQ4当模型在不同域(如Librispeech)上训练时,动态重叠推理(DOI)是否能显著降低长音频上的WER?
- RQ5当域差距较大或较小时,不同正则化技术在有效性上如何比较?
主要发现
- 在短YouTube片段上训练的非流式RNN-T模型,通过正则化组合策略,WER从22.3%降低至14.8%,相对改进达33.6%。
- 在搜索查询上训练的流式RNN-T模型,在YouTube长音频测试集上实现62%的相对WER改进,错误率从67.0%降至25.3%。
- 在Librispeech上训练时,仅使用正则化组合策略未能改善泛化性能,但DOI将WER从99.8%降低至33.0%(在YouTube短音频测试集上)。
- DOI显著降低了删除错误率,从99.5%降至3.6%(在YouTube测试集上),但替换错误仍较高(22.2%),表明存在音素混淆问题。
- 正则化组合策略效果最佳;单一技术如SpecAugment或变分噪声仅带来有限提升。
- DOI对流式模型无改善效果,可能是因为端到端流式系统中对齐质量差,除非在训练中加以约束。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。