[论文解读] Learning Noise-Invariant Representations for Robust Speech Recognition
本文提出了一种不变表示学习(Invariant-Representation Learning, IRL)正则化方法,该方法在训练过程中促使深度神经网络对干净语音及其噪声版本产生相同的隐藏表示。通过使用L2和余弦相似度惩罚中间层表示之间的距离,IRL在干净语音和其他Librispeech测试集上的字符错误率(CER)降低了45%以上,显著优于数据增强和先前基线方法,尤其在分布外噪声条件下表现更优。
Despite rapid advances in speech recognition, current models remain brittle to superficial perturbations to their inputs. Small amounts of noise can destroy the performance of an otherwise state-of-the-art model. To harden models against background noise, practitioners often perform data augmentation, adding artificially-noised examples to the training set, carrying over the original label. In this paper, we hypothesize that a clean example and its superficially perturbed counterparts shouldn't merely map to the same class --- they should map to the same representation. We propose invariant-representation-learning (IRL): At each training iteration, for each training example,we sample a noisy counterpart. We then apply a penalty term to coerce matched representations at each layer (above some chosen layer). Our key results, demonstrated on the Librispeech dataset are the following: (i) IRL significantly reduces character error rates (CER) on both 'clean' (3.3% vs 6.5%) and 'other' (11.0% vs 18.1%) test sets; (ii) on several out-of-domain noise settings (different from those seen during training), IRL's benefits are even more pronounced. Careful ablations confirm that our results are not simply due to shrinking activations at the chosen layers.
研究动机与目标
- 解决当前最先进自动语音识别(ASR)模型对输入噪声的脆弱性问题,即使微小扰动也会严重降低性能。
- 克服标准数据增强方法的局限性,后者仅鼓励类别级不变性,而非表示级不变性。
- 开发一种方法,强制对同一输入的干净和噪声版本生成相同的隐藏表示,从而在不牺牲推理速度的前提下提升鲁棒性。
- 证明表示级不变性相比logit级不变性或标准正则化技术,能带来更强的泛化能力。
提出的方法
- 在每次训练迭代中,对每个干净输入,通过从MUSAN数据集中随机选取一段噪声并以随机音量叠加到原始波形上,合成对应的噪声版本。
- 模型通过同一网络处理干净和噪声输入,在每一层生成隐藏表示。
- 应用正则化损失,以最小化干净与噪声样本对应隐藏表示之间的L2距离和余弦相似度距离。
- 总损失由预测的交叉熵损失和表示不变性惩罚项组成,促使网络学习到对噪声鲁棒的特征。
- 不变性惩罚仅应用于选定层(如编码器层)之上的层,使早期层仍能对输入变化保持敏感。
- 该方法在Librispeech数据集上进行评估,采用序列到序列模型和交叉熵损失,不使用语言模型,以隔离IRL的影响。

实验结果
研究问题
- RQ1强制对干净语音和噪声语音输入生成相同隐藏表示,能否提升自动语音识别的鲁棒性?
- RQ2表示级不变性是否优于logit级不变性或标准数据增强方法,在处理分布外噪声时表现更优?
- RQ3IRL带来的性能提升是源于激活值缩小,还是实际的表示对齐?
- RQ4在多种噪声条件下,IRL与对抗训练及其他正则化技术相比,泛化能力如何?
主要发现
- 在Librispeech测试集(test-clean)上,IRL将字符错误率(CER)降低至3.3%,相比基线的6.5%,相对提升49%;在test-other集上,CER为11.0%,相比基线的18.1%,相对提升40%。
- 在混响等分布外噪声条件下,IRL-C的CER为13.8%,显著优于数据增强模型(21.0%)和基线模型(24.1%),表现出强大的鲁棒性提升。
- 在重叠语音噪声条件下,IRL-C的CER为14.1%,远优于基线模型(91.5%)和数据增强模型(32.0%)。
- 在低信噪比(SNR)条件下,IRL-C的CER为5.7%,优于基线模型(10.8%)和数据增强模型(27.8%)。
- 在重采样后的电话语音数据上,IRL模型保持优异性能(CER为6.4%),优于基线模型(14.2%)和数据增强模型(12.2%)。
- 实证分析证实,IRL同时降低了干净与噪声表示之间的L2距离和余弦距离,且IRL-C在所有层中均保持紧密对齐,而IRL-E在编码器层之后出现偏离。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。