[论文解读] Data Augmentation for Training Dialog Models Robust to Speech Recognition Errors
本文提出一种数据增强方法,通过使用基于混淆矩阵的错误模拟器模拟ASR噪声,提升对话模型对自动语音识别(ASR)错误的鲁棒性。该方法在不修改模型架构或引入推理延迟的情况下,提升了模型性能,尤其在低资源设置下表现更优。
Speech-based virtual assistants, such as Amazon Alexa, Google assistant, and Apple Siri, typically convert users' audio signals to text data through automatic speech recognition (ASR) and feed the text to downstream dialog models for natural language understanding and response generation. The ASR output is error-prone; however, the downstream dialog models are often trained on error-free text data, making them sensitive to ASR errors during inference time. To bridge the gap and make dialog models more robust to ASR errors, we leverage an ASR error simulator to inject noise into the error-free text data, and subsequently train the dialog models with the augmented data. Compared to other approaches for handling ASR errors, such as using ASR lattice or end-to-end methods, our data augmentation approach does not require any modification to the ASR or downstream dialog models; our approach also does not introduce any additional latency during inference time. We perform extensive experiments on benchmark data and show that our approach improves the performance of downstream dialog models in the presence of ASR errors, and it is particularly effective in the low-resource situations where there are constraints on model size or the training data is scarce.
研究动机与目标
- 解决对话模型在推理过程中对ASR错误敏感的问题,尽管其在无错误文本上进行训练。
- 克服现有方法需要ASR解码轨迹访问、模型微调或引入额外推理延迟的局限性。
- 在训练数据有限或模型规模受限的低资源场景下,实现对ASR错误的鲁棒性。
- 开发一种即插即用的数据增强解决方案,可与任何现有的对话模型和ASR系统兼容。
- 在多种模型架构(包括小型和轻量级模型)上验证其有效性。
提出的方法
- 使用基于混淆矩阵的ASR错误模拟器,通过在干净参考文本中注入常见词级错误,生成合成ASR假设。
- 从对齐的ASR假设和参考文本中构建n-gram混淆矩阵,以建模频繁的词替换和错误。
- 在训练过程中应用该错误模拟器,将真实ASR风格的变体注入干净文本数据中。
- 在原始数据和增强数据上联合训练下游对话模型(如意图分类模型),以提升鲁棒性。
- 保持模型架构和推理流程不变,避免推理阶段引入任何延迟。
- 支持存在和不存在现有ASR假设的两种场景,从而广泛适用于不同来源的训练数据。
实验结果
研究问题
- RQ1使用模拟ASR错误生成器进行数据增强,能否提升对话模型对真实世界ASR错误的鲁棒性?
- RQ2在训练数据有限或模型架构较小的低资源设置下,该方法的有效性如何?
- RQ3该方法在不同对话模型架构(包括轻量级模型)上是否均能保持性能提升?
- RQ4与需要ASR解码轨迹或端到端集成的方法相比,该方法在推理效率方面表现如何?
- RQ5该方法能否与其他技术(如声学嵌入或多任务学习)结合以获得进一步增益?
主要发现
- 所提出的数据显示增强方法显著提升了对话模型在ASR错误下的性能,当仅使用1%数据进行训练时,BERT模型的准确率绝对提升达20.18%。
- 对于简单的神经网络(Simple NN),当使用5%数据训练时,准确率绝对提升达35.20%,表明在低数据环境下具有显著优势。
- 对于轻量级模型(GloVe + 1-layer LSTM),S1和S2的准确率分别提升3.89%和2.34%,表明即使不使用大规模预训练嵌入,该方法也具有效果。
- 性能提升在低资源设置下最为显著,最大改进出现在最小的训练子集上。
- 即使在模型简化后,该方法仍保持有效性,表明其在资源受限(如延迟或大小受限)部署中具有强大实用价值。
- 该方法与其他技术(如声学嵌入和多任务学习)具有互补性,表明结合使用可进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。