[论文解读] Bridging the Gap Between Clean Data Training and Real-World Inference for Spoken Language Understanding
该论文提出RoSLU,一种基于领域自适应的方法,通过将干净样本与噪声样本联合嵌入共享向量空间,并利用去噪生成器纠正错误,从而弥合干净数据训练与真实世界噪声推理之间的差距。该方法在噪声和干净测试集上均达到最先进性能,在Snips数据集上噪声推理下的F1分数相比基线模型提升+3.8分。
Spoken language understanding (SLU) system usually consists of various pipeline components, where each component heavily relies on the results of its upstream ones. For example, Intent detection (ID), and slot filling (SF) require its upstream automatic speech recognition (ASR) to transform the voice into text. In this case, the upstream perturbations, e.g. ASR errors, environmental noise and careless user speaking, will propagate to the ID and SF models, thus deteriorating the system performance. Therefore, the well-performing SF and ID models are expected to be noise resistant to some extent. However, existing models are trained on clean data, which causes a extit{gap between clean data training and real-world inference.} To bridge the gap, we propose a method from the perspective of domain adaptation, by which both high- and low-quality samples are embedding into similar vector space. Meanwhile, we design a denoising generation model to reduce the impact of the low-quality samples. Experiments on the widely-used dataset, i.e. Snips, and large scale in-house dataset (10 million training examples) demonstrate that this method not only outperforms the baseline models on real-world (noisy) corpus but also enhances the robustness, that is, it produces high-quality results under a noisy environment. The source code will be released.
研究动机与目标
- 解决工业级SLU系统中干净数据训练与真实世界噪声推理之间的分布差距。
- 提升模型对实际扰动(如ASR错误、环境噪声和随意发音)的鲁棒性。
- 使槽位填充模型能够纠正槽内错误——这类错误在真实输入中常见,但传统模型无法处理。
- 开发一种在保持干净数据高性能的同时,显著提升噪声数据性能的方法。
- 证明领域自适应与去噪生成在弥合真实世界推理差距方面的有效性。
提出的方法
- 该方法采用领域自适应,将高质量干净样本与低质量噪声样本映射到共享且相似的向量空间。
- 训练一个去噪生成器模型,从噪声输入序列重建正确的槽位标签,从而提升对输入扰动的鲁棒性。
- 模型在干净数据与合成噪声数据的组合上进行端到端训练,使其能够泛化至真实世界的噪声输入。
- 该方法采用对抗性训练原则进行正则化,提升在分布偏移下的泛化能力。
- 该框架旨在保持干净数据上的性能,同时显著提升在噪声测试集上的鲁棒性。
- 通过模型将语义相似但存在噪声的槽位片段(例如将‘rock stones’映射为‘the Rolling Stones’)正确形式化,实现槽内错误纠正。
实验结果
研究问题
- RQ1在同时使用干净与噪声数据进行训练的模型,是否能在不牺牲干净数据性能的前提下,实现更强的真实世界SLU推理鲁棒性?
- RQ2去噪生成器在多大程度上能纠正由ASR或语音变化引起的槽内错误?
- RQ3在干净与噪声样本之间进行领域自适应,是否能有效弥合SLU系统中的分布差距?
- RQ4在噪声与干净测试集上的F1分数方面,该方法与强基线模型相比表现如何?
- RQ5该模型能否在包含数百万样本和复杂噪声模式的大规模工业数据集上实现良好泛化?
主要发现
- 在Snips数据集上,RoSLU在噪声推理下相比最佳基线模型F1分数提升+3.8分,展现出强大鲁棒性。
- 在包含1000万条训练样本的内部数据集上,尽管基线分数已很高,RoSLU在全局(噪声)训练设置下仍比基线提升+0.64 F1分。
- 在干净推理上,该模型与SOTA模型性能相当,Snips数据集F1得分为91.24,内部数据集为96.01。
- 人工评估确认,在177个抽样槽内错误中,有59个被成功纠正,验证了模型处理真实世界噪声的能力。
- 在较小数据集(如Snips)上,训练时引入噪声数据带来的性能增益更显著,噪声在此起到正则化作用。
- 结果表明,领域自适应与去噪生成联合提升了泛化能力,尤其在真实世界噪声场景下效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。