[论文解读] Supervised Contrastive Learning for Accented Speech Recognition
本文提出一种监督对比学习框架,通过学习与口音无关的表征来提升口音语音识别性能。通过应用数据增强技术——噪声注入、频谱图增强和TTS同句生成——构建正样本视图,该方法在联合训练基础上将词错误率(WER)分别降低3.66%(零样本)和3.78%(全样本),显著提升了对不熟悉口音的鲁棒性。
Neural network based speech recognition systems suffer from performance degradation due to accented speech, especially unfamiliar accents. In this paper, we study the supervised contrastive learning framework for accented speech recognition. To build different views (similar "positive" data samples) for contrastive learning, three data augmentation techniques including noise injection, spectrogram augmentation and TTS-same-sentence generation are further investigated. From the experiments on the Common Voice dataset, we have shown that contrastive learning helps to build data-augmentation invariant and pronunciation invariant representations, which significantly outperforms traditional joint training methods in both zero-shot and full-shot settings. Experiments show that contrastive learning can improve accuracy by 3.66% (zero-shot) and 3.78% (full-shot) on average, comparing to the joint training method.
研究动机与目标
- 解决神经网络自动语音识别系统在不熟悉或未见过的口音语音上性能下降的问题。
- 探究监督对比学习是否能在不修改网络架构的前提下提升对口音差异的鲁棒性。
- 研究数据增强技术在语音对比学习中生成有意义正样本视图的有效性。
- 证明对比学习可在端到端自动语音识别中学习到与发音和数据增强无关的表征。
- 在零样本和全样本设置下评估该方法的泛化能力和适应能力。
提出的方法
- 应用监督对比学习损失,促使来自不同口音的相同音素或字符的嵌入更加接近,同时拉远不同类别的嵌入距离。
- 使用三种数据增强技术——噪声注入、频谱图增强和TTS同句生成——为同一语言目标创建多样化的正样本视图。
- 使用对比损失函数进行模型训练,最大化同一标签的增强视图之间的相似性,同时最小化与其他标签的相似性。
- 将对比损失集成到标准端到端自动语音识别模型(如基于Conformer的模型)中,不修改网络架构。
- 利用标签信息定义正样本对(跨口音的相同音素),避免无监督对比学习中常见的错误负样本。
- 通过t-SNE可视化隐藏表征,定性验证来自不同口音但相同音素的样本聚类在一起。
实验结果
研究问题
- RQ1监督对比学习是否能在不修改网络架构的前提下提升口音语音识别的鲁棒性?
- RQ2不同数据增强技术(噪声、频谱图、TTS)在语音对比学习中生成有用正样本视图的有效性如何?
- RQ3与联合训练相比,对比学习是否能生成更好的发音不变和数据增强不变表征?
- RQ4在口音语音识别的零样本和全样本设置下,对比学习相对于联合训练的性能增益如何?
- RQ5所提方法是否能泛化到其他鲁棒性挑战(如噪声或混响)?
主要发现
- 与联合训练相比,监督对比学习在零样本设置下平均降低WER 3.66%,在全样本设置下降低3.78%。
- 频谱图增强带来的提升最高,绝对降低WER 7.39%(零样本)和7.63%(全样本)。
- TTS同句生成在零样本下增益有限(WER降低0.13%),但在全样本下降低2.93%,表明在更多数据下更具优势。
- t-SNE可视化证实,对比学习将来自不同口音但相同音素的样本聚类在一起,证明了与口音无关表征的学习能力。
- 即使不使用数据增强,仅对比损失本身也使WER在零样本下降低1.35%,全样本下降低0.7%,表明损失函数本身具有内在优势。
- 将所有数据增强方法与对比学习结合,可实现最大的WER降低:相比联合训练,零样本降低7.99%,全样本降低8.94%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。