Skip to main content
QUICK REVIEW

[论文解读] Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling

Peidong Wang, Ke Tan|arXiv (Cornell University)|Mar 11, 2019
Speech and Audio Processing参考文献 32被引用 4
一句话总结

本文提出了一种与失真无关的声学建模方法,以弥合单耳语音增强与自动语音识别(ASR)之间的差距,其中增强引起的失真通常会降低ASR性能。通过在包括噪声、混响和增强伪影在内的多种失真上进行声学模型训练,该方法能够泛化到未见过的失真,从而在CHiME-2数据集上实现了9.2%的最先进词错误率(WER),相较于先前系统相对提升了6.5%,并在多个增强前端中表现出鲁棒性。

ABSTRACT

Monaural speech enhancement has made dramatic advances since the introduction of deep learning a few years ago. Although enhanced speech has been demonstrated to have better intelligibility and quality for human listeners, feeding it directly to automatic speech recognition (ASR) systems trained with noisy speech has not produced expected improvements in ASR performance. The lack of an enhancement benefit on recognition, or the gap between monaural speech enhancement and recognition, is often attributed to speech distortions introduced in the enhancement process. In this study, we analyze the distortion problem, compare different acoustic models, and investigate a distortion-independent training scheme for monaural speech recognition. Experimental results suggest that distortion-independent acoustic modeling is able to overcome the distortion problem. Such an acoustic model can also work with speech enhancement models different from the one used during training. Moreover, the models investigated in this paper outperform the previous best system on the CHiME-2 corpus.

研究动机与目标

  • 为解决单耳语音增强与ASR之间长期存在的性能差距,即增强后的语音往往因失真而无法提升识别性能。
  • 探究在多种失真下训练的声学模型是否能泛化到训练时未见过的增强伪影。
  • 评估与失真无关的声学建模方法在不同语音增强前端和噪声条件下的有效性。
  • 在CHiME-2基准测试中超越先前系统,特别是在混响和噪声环境中。
  • 证明大规模训练于多样化失真可使模型泛化到未见过的失真,包括来自不同增强模型的失真。

提出的方法

  • 该研究在包含10,000种不同噪声类型(包括加性噪声、混响(RIRs)和增强伪影)的语音大规模数据集上训练声学模型。
  • 提出一种与失真无关的声学建模方法,将所有失真视为训练分布的一部分,避免依赖干净语音或特定增强输出。
  • 在训练中使用逐句循环dropout,以提升对序列级变化的泛化能力和鲁棒性。
  • 在不同增强条件下,对比五种声学模型类型:噪声无关、混响无关、与失真无关及其他类型。
  • 在CHiME-2和ADT数据集上,使用WER作为主要指标,评估模型在多个增强前端(LSTM、CRN、IRM)下的表现。
  • 训练策略明确避免说话人自适应,以隔离失真鲁棒性对识别性能的影响。

实验结果

研究问题

  • RQ1在广泛失真下训练的声学模型是否能泛化到训练时未见过的增强引起的失真?
  • RQ2在使用增强语音时,与失真无关的声学建模是否优于传统的噪声或混响依赖型模型?
  • RQ3一个单一的与失真无关的声学模型是否能有效适配多个语音增强前端,即使增强模型与训练时不同?
  • RQ4在多样化失真上进行大规模训练,在多大程度上提升了对未训练失真在真实ASR场景中的泛化能力?
  • RQ5与CHiME-2基准测试中的先前最先进系统相比,与失真无关建模的性能如何?

主要发现

  • 与失真无关的声学模型在CHiME-2语料库上实现了9.2%的平均WER,相较于之前最佳系统相对提升了6.5%。
  • 依赖噪声的声学模型实现了8.7%的平均WER,同样超越了先前的最先进系统。
  • 在9dB和3dB信噪比条件下,使用与失真无关模型增强的语音,其WER低于未增强语音,证实了在结合鲁棒声学建模时增强的有效性。
  • 与失真无关的模型在多个增强前端(LSTM、CRN、IRM)上表现良好,表明其对不同类型增强伪影具有泛化能力。
  • 该模型能泛化到未训练的失真,包括RIR不匹配和未见过的增强方法,展现出强大的鲁棒性。
  • 即使在混响语音上平均WER仅为3.4%,该模型仍表明,与失真无关的训练可使复杂声学环境下的有效识别成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。