[论文解读] Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability
该论文提出了一种高精度的RNN-T模型,通过优化训练、改进初始化以及引入未来上下文感知机制,超越了最先进的混合式ASR系统。通过仅使用文本数据对TTS生成的音频进行微调,仅更新预测网络和联合网络,该方法在不增加推理运行时开销的情况下显著降低了WER,优于语言模型重排序和拼写纠正方法。
Because of its streaming nature, recurrent neural network transducer (RNN-T) is a very promising end-to-end (E2E) model that may replace the popular hybrid model for automatic speech recognition. In this paper, we describe our recent development of RNN-T models with reduced GPU memory consumption during training, better initialization strategy, and advanced encoder modeling with future lookahead. When trained with Microsoft's 65 thousand hours of anonymized training data, the developed RNN-T model surpasses a very well trained hybrid model with both better recognition accuracy and lower latency. We further study how to customize RNN-T models to a new domain, which is important for deploying E2E models to practical scenarios. By comparing several methods leveraging text-only data in the new domain, we found that updating RNN-T's prediction and joint networks using text-to-speech generated from domain-specific text is the most effective.
研究动机与目标
- 开发一种RNN-T模型,通过三阶段优化和先进的声学建模,超越使用3阶段优化和先进声学建模训练的高性能混合式ASR系统。
- 通过优化词件子标记化和内存组织方式,降低RNN-T训练期间的GPU显存消耗。
- 通过交叉熵初始化和编码器中的未来上下文建模,提升RNN-T识别准确率。
- 研究仅使用特定领域文本数据(无需转录语音)有效定制RNN-T模型的方法。
- 比较基于TTS的适应、拼写纠正、语言模型重排序和数据混合在端到端ASR中领域适应的有效性。
提出的方法
- 通过将空格标记替换为下划线标记以表示词的起始,减少词件子单元(WPU)分解数量,GPU显存使用量降低近一半。
- 通过使用时间对齐的音频特征和WPU转录进行交叉熵(CE)训练初始化RNN-T编码器,提升训练稳定性和准确率。
- 通过在编码器中引入2帧的未来上下文感知机制,增强建模能力,使上下文感知表示更优,从而改善序列转换。
- 通过生成合成TTS音频并仅微调预测网络和联合网络,利用特定领域的文本数据对RNN-T模型进行定制化。
- 评估了替代性定制方法:使用LSTM-LM进行语言模型重排序、使用基于Transformer的模型进行拼写纠正,以及混合真实语音与TTS数据。
- 使用预训练的RoBERTa模型提升拼写纠正性能,相比非预训练版本实现更优的WER降低效果。
实验结果
研究问题
- RQ1通过优化初始化和未来上下文建模训练的RNN-T模型,是否能在准确率和延迟方面超越高性能混合式ASR系统?
- RQ2当仅拥有文本数据时,基于TTS的数据增强在将RNN-T模型适应到新领域方面是否有效?
- RQ3仅使用TTS生成的音频微调预测和联合网络,是否优于需要额外推理时组件(如语言模型重排序或拼写纠正)的方法?
- RQ4在低资源领域场景下,混合真实语音数据与TTS生成数据对模型适应有何影响?
- RQ5在大规模文本上预训练(如RoBERTa)如何提升用于RNN-T适应的拼写纠正模型的性能?
主要发现
- 采用CE初始化和2帧未来上下文感知的RNN-T模型相比基线模型实现11.6%的相对WER降低,并在相对WER上超越最佳混合模型3.1%。
- 最终的RNN-T模型相比最佳混合模型,编码器前瞻延迟降低120 ms,证明了流式处理效率的提升。
- 仅使用领域特定文本生成的TTS音频对预测和联合网络进行微调,分别在1280p640x6、1600p800_4x6和2560p800_4x6模型上实现7.9%、7.2%和9.8%的相对WER降低。
- 仅使用TTS的适应方法优于混合真实语音与TTS数据的方法,表明仅凭足够的文本数据即可有效适应模型,无需额外真实语音数据。
- 在领域文本上微调的RoBERTa进行拼写纠正,分别在1280p640x6和1600p800_4x6模型上实现7.9%和6.1%的相对WER降低,优于非预训练版本。
- 使用领域特定LSTM-LM进行语言模型重排序,分别实现3.9%和1.6%的相对WER降低,但需要额外的运行时计算,而参数高效的TTS适应方法则无此开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。