Skip to main content
QUICK REVIEW

[论文解读] Joint Training of Speech Enhancement and Self-supervised Model for Noise-robust ASR

Qiushi Zhu, Jie Zhang|arXiv (Cornell University)|May 26, 2022
Speech and Audio Processing被引用 8
一句话总结

该论文提出了一种联合预训练框架,同时优化语音增强(SE)和自监督表征学习(如wav2vec2.0),以实现抗噪自动语音识别(ASR)。通过使用双注意力融合模块,在噪声波形和增强输出上联合训练,该方法减少了语音失真,在真实世界噪声数据集上实现了最先进的词错误率(WER):验证集为8.2,测试集为14.3,优于先前的方法,包括那些需要仔细初始化的方法。

ABSTRACT

Speech enhancement (SE) is usually required as a front end to improve the speech quality in noisy environments, while the enhanced speech might not be optimal for automatic speech recognition (ASR) systems due to speech distortion. On the other hand, it was shown that self-supervised pre-training enables the utilization of a large amount of unlabeled noisy data, which is rather beneficial for the noise robustness of ASR. However, the potential of the (optimal) integration of SE and self-supervised pre-training still remains unclear. In order to find an appropriate combination and reduce the impact of speech distortion caused by SE, in this paper we therefore propose a joint pre-training approach for the SE module and the self-supervised model. First, in the pre-training phase the original noisy waveform or the waveform obtained by SE is fed into the self-supervised model to learn the contextual representation, where the quantified clean speech acts as the target. Second, we propose a dual-attention fusion method to fuse the features of noisy and enhanced speeches, which can compensate the information loss caused by separately using individual modules. Due to the flexible exploitation of clean/noisy/enhanced branches, the proposed method turns out to be a generalization of some existing noise-robust ASR models, e.g., enhanced wav2vec2.0. Finally, experimental results on both synthetic and real noisy datasets show that the proposed joint training approach can improve the ASR performance under various noisy settings, leading to a stronger noise robustness.

研究动机与目标

  • 解决由于噪声环境中语音失真导致的语音增强(SE)与自动语音识别(ASR)之间的不匹配问题。
  • 通过联合预训练SE和自监督模型,而非分别训练,来提升ASR在噪声环境下的鲁棒性。
  • 通过支持从随机权重开始的有效训练,减少对仔细模型初始化的依赖。
  • 促进噪声语音、增强语音和干净语音分支之间的信息融合,以减轻失真并提升ASR性能。
  • 通过支持灵活利用多个输入分支(噪声、增强、干净)的能力,推广现有抗噪ASR模型。

提出的方法

  • 使用原始噪声波形和SE增强波形作为输入,联合预训练一个自监督模型(例如wav2vec2.0),以量化后的干净语音作为对比学习的目标。
  • 引入双注意力融合模块,融合来自噪声语音和增强语音分支的特征,通过交叉注意力机制补偿信息损失。
  • 应用向量量化(VQ)操作,从未标注数据中学习离散语音单元,提升在噪声条件下的表征质量。
  • 在干净语音和噪声语音特征之间引入一致性损失,以对齐表征并增强对噪声的鲁棒性。
  • 使用统一目标函数端到端联合训练SE模块与自监督模型,避免因分别优化而引入的失真。
  • 允许整个模型随机初始化,并通过优化理论验证其收敛性与失真减少。

实验结果

研究问题

  • RQ1联合预训练语音增强与自监督模型是否能减少语音失真并提升噪声环境中ASR的性能?
  • RQ2与仅使用单一分支相比,噪声与增强语音特征的双注意力融合在ASR鲁棒性方面表现如何?
  • RQ3所提出的方法在随机初始化下是否仍能保持强性能,而无需像先前方法那样依赖仔细初始化?
  • RQ4VQ操作与干净语音和噪声语音之间的一致性损失在真实世界噪声环境中的引入,能在多大程度上提升抗噪鲁棒性?
  • RQ5该联合框架能否推广至现有抗噪ASR模型(如增强版wav2vec2.0)?

主要发现

  • 所提方法在dt05_real验证集上实现8.2的词错误率(WER),在et05_real测试集上实现14.3的WER,相较于基线EW2模型(WER 9.4和15.6)相对提升约10%。
  • 在使用基于Transformer的语言模型时,该方法仍保持一致的性能提升,证明了联合训练的有效性,即使在引入外部语言模型的情况下亦然。
  • 该方法优于最先进的监督方法,如[15](WER 3.5/6.8)和[40](WER 2.8/5.8),在无需复杂数据增强或辅助处理的情况下实现了具有竞争力的结果。
  • 该模型在随机初始化下仍保持强性能,性能下降极小,而先前方法需仔细初始化才能收敛。
  • 双注意力融合模块有效减少了信息损失与语音失真,这在合成与真实噪声数据集上均表现为WER的提升。
  • 引入VQ操作以及干净语音与噪声语音特征之间的一致性损失,显著增强了在实际真实噪声环境中的抗噪鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。