[论文解读] Data Techniques For Online End-to-end Speech Recognition
本文提出了一套以数据为中心的技术——领域自适应、数据增强以及使用未转录数据的知识蒸馏,以在有限的领域内数据条件下提升在线端到端自动语音识别(ASR)性能。通过在单向CTC模型上结合这些方法,作者在WSJ数据集上实现了超过50%的相对词错误率(WER)降低,在一个具有挑战性的对话式语音数据集上实现了25.4%的相对性能提升,优于强基线模型以及在更多数据上训练的双向模型。
Practitioners often need to build ASR systems for new use cases in a short amount of time, given limited in-domain data. While recently developed end-to-end methods largely simplify the modeling pipelines, they still suffer from the data sparsity issue. In this work, we explore a few simple-to-implement techniques for building online ASR systems in an end-to-end fashion, with a small amount of transcribed data in the target domain. These techniques include data augmentation in the target domain, domain adaptation using models previously trained on a large source domain, and knowledge distillation on non-transcribed target domain data, using an adapted bi-directional model as the teacher; they are applicable in real scenarios with different types of resources. Our experiments demonstrate that each technique is independently useful in the improvement of the online ASR performance in the target domain.
研究动机与目标
- 解决在有限领域内转录数据条件下构建高精度在线端到端ASR系统的挑战。
- 提升在数据稀疏性限制模型准确率的低资源、真实世界ASR场景下的性能。
- 开发实用且易于实现的数据技术,适用于资源可用性各异的真实系统部署。
- 证明在低数据环境下,通过数据操作而非增加模型复杂度,即可实现显著的性能提升。
提出的方法
- 直接在领域内转录数据上应用数据增强技术,以提升训练的多样性与鲁棒性。
- 使用源领域预训练的单向CTC模型进行领域自适应,并在有限的领域内数据上进行微调。
- 提出一种新颖的教师-学生蒸馏框架:使用在领域内数据上训练的双向模型生成伪标签,通过未转录的目标数据将知识蒸馏到单向学生模型中。
- 学生模型采用5层单向LSTM架构,教师模型采用5层双向LSTM,两者均在相同源领域数据上进行训练。
- 采用帧堆叠(3倍)和按说话人均值归一化,以提升训练效率与鲁棒性。
- 使用ADAM优化器进行训练,并采用语言模型和词典(来自Kaldi配方)进行束搜索解码,同时对<blank>符号的先验概率进行调优。
实验结果
研究问题
- RQ1在有限领域内转录数据上应用数据增强是否能显著提升在线端到端ASR性能?
- RQ2从大规模源领域预训练模型进行领域自适应,在低资源目标领域上能带来多大程度的性能提升?
- RQ3使用未转录数据和双向教师模型的知识蒸馏是否能有效将建模能力迁移至单向学生模型?
- RQ4这些技术如何协同作用?当联合应用时,累积性能增益如何?
主要发现
- 在WSJ语料库上,结合领域自适应、数据增强和知识蒸馏后,WER从基线的17.72%(基于15小时领域内数据)降低至7.58%,实现了超过50%的相对提升。
- 所提方法优于在相同数量未标注数据上训练的双向CTC模型(WER为13.50%),也优于在更多领域内数据上训练的单向模型(WER为11.98%)。
- 在具有挑战性的对话式语音数据集上,该方法实现了25.4%的相对WER提升,测试集错误率从27.68%降低至20.64%。
- 每项独立技术——数据增强、领域自适应和无监督知识蒸馏——均带来了可测量且可叠加的性能增益。
- 使用未转录数据的教师-学生蒸馏框架在这一低数据、在线ASR设置下尤为有效且具有创新性。
- 在不同说话风格的数据集上结果一致,证实了所提技术的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。