[论文解读] Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs for Robust Speech Recognition
本文提出 wav2vec-Switch,一种自监督学习方法,通过在原始语音与带噪语音对上联合训练,并采用一种新颖的对比学习目标,增强了语音表征的抗噪鲁棒性。在训练过程中,通过在原始输入与带噪输入之间交换量化目标,模型学习到一致且与噪声无关的表征,相较于数据增强基线方法,在合成带噪 LibriSpeech 数据上实现 2.9–4.9% 的相对 WER 降低,在真实 CHiME-4 数据上实现 5.7% 的降低,性能优于数据增强基线方法,且与配备专用增强模块的系统相当或更优。
The goal of self-supervised learning (SSL) for automatic speech recognition (ASR) is to learn good speech representations from a large amount of unlabeled speech for the downstream ASR task. However, most SSL frameworks do not consider noise robustness which is crucial for real-world applications. In this paper we propose wav2vec-Switch, a method to encode noise robustness into contextualized representations of speech via contrastive learning. Specifically, we feed original-noisy speech pairs simultaneously into the wav2vec 2.0 network. In addition to the existing contrastive learning task, we switch the quantized representations of the original and noisy speech as additional prediction targets of each other. By doing this, it enforces the network to have consistent predictions for the original and noisy speech, thus allows to learn contextualized representation with noise robustness. Our experiments on synthesized and real noisy data show the effectiveness of our method: it achieves 2.9--4.9% relative word error rate (WER) reduction on the synthesized noisy LibriSpeech data without deterioration on the original data, and 5.7% on CHiME-4 real 1-channel noisy data compared to a data augmentation baseline even with a strong language model for decoding. Our results on CHiME-4 can match or even surpass those with well-designed speech enhancement components.
研究动机与目标
- 在不增加外部模块的前提下,提升自监督语音表征学习在自动语音识别(ASR)中的抗噪鲁棒性。
- 解决现有自监督模型在预训练过程中未显式考虑噪声的局限性。
- 开发一种通过成对原始语音与带噪语音输入进行对比学习来增强鲁棒性的方法。
- 在仅使用无标签数据的前提下,实现与使用复杂语音增强组件的系统相当或更优的性能。
提出的方法
- 该方法将原始语音与带噪语音对同时输入 wav2vec 2.0 网络,在单个批次中进行训练。
- 在掩码表示上应用标准对比损失,但引入一种新颖的目标切换机制:将原始语音与带噪语音的量化目标互换作为正样本。
- 这迫使模型对原始语音与带噪语音版本产生一致的预测,从而促进学习与噪声无关的表征。
- 训练目标结合了原始对比损失与切换目标对比损失,且不修改网络架构。
- 相同的丢弃掩码与掩码位置在原始-带噪对之间保持一致,以确保学习的一致性。
- 模型在 960 小时无标签 LibriSpeech 与 MUSAN 数据上进行预训练,随后使用 CTC 进行 ASR 微调。

实验结果
研究问题
- RQ1在原始-带噪语音对上进行对比学习,能否提升自监督 ASR 模型的抗噪鲁棒性?
- RQ2强制原始语音与带噪语音表征之间预测一致性,是否能提升在噪声条件下的泛化能力?
- RQ3像目标切换这样简单且架构无关的方法,能否在真实世界语音识别中超越复杂的语音增强流水线?
- RQ4该方法在噪声不匹配条件下以及配合强语言模型时表现如何?
主要发现
- 与数据增强基线相比,wav2vec-Switch 在合成带噪 LibriSpeech 数据上实现了 2.9–4.9% 的相对 WER 降低,即使在使用强语言模型的情况下依然有效。
- 在真实 1 通道 CHiME-4 数据上,该方法相较同一基线实现了 5.7% 的相对 WER 降低,性能优于配备专用增强模块的系统。
- 模型在干净测试集上保持了强劲性能,表明在原始(干净)语音数据上无性能退化。
- 消融实验表明,保持原始-带噪对之间相同的丢弃掩码与掩码位置至关重要,偏离该设置会导致 WER 显著下降。
- 该方法在 CHiME-4 上实现了最先进性能,且完全不依赖任何语音增强组件,仅使用无标签数据的自监督预训练。
- 即使不使用语言模型,wav2vec-Switch 在合成带噪数据上仍实现 7.1–11.0% 的 WER 降低,展现出强大的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。