Skip to main content
QUICK REVIEW

[论文解读] On Cross-Corpus Generalization of Deep Learning Based Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|Feb 10, 2020
Speech and Audio Processing参考文献 40被引用 5
一句话总结

本文 identifies channel mismatch 作为深度学习语音增强中跨语料泛化能力差的主要原因,尤其是在低信噪比(SNR)条件下。提出两种关键解决方案:在多样化的众包语料库(如 LibriAll)上进行训练,以及使用更小的 STFT 帧移,两者结合可显著提升在未见语料上的性能,在 IEEE Male 于 -5 dB SNR 条件下 STOI 提升高达 8.1%。

ABSTRACT

In recent years, supervised approaches using deep neural networks (DNNs) have become the mainstream for speech enhancement. It has been established that DNNs generalize well to untrained noises and speakers if trained using a large number of noises and speakers. However, we find that DNNs fail to generalize to new speech corpora in low signal-to-noise ratio (SNR) conditions. In this work, we establish that the lack of generalization is mainly due to the channel mismatch, i.e. different recording conditions between the trained and untrained corpus. Additionally, we observe that traditional channel normalization techniques are not effective in improving cross-corpus generalization. Further, we evaluate publicly available datasets that are promising for generalization. We find one particular corpus to be significantly better than others. Finally, we find that using a smaller frame shift in short-time processing of speech can significantly improve cross-corpus generalization. The proposed techniques to address cross-corpus generalization include channel normalization, better training corpus, and smaller frame shift in short-time Fourier transform (STFT). These techniques together improve the objective intelligibility and quality scores on untrained corpora significantly.

研究动机与目标

  • 调查基于深度学习的语音增强模型为何无法泛化到未见语音语料,尤其是在低 SNR 条件下。
  • 识别在低 SNR 条件下跨语料泛化能力差的根本原因。
  • 评估传统信道归一化技术(如 CMS、RASTA)在提升监督语音增强中跨语料泛化能力方面的有效性。
  • 评估公开可用数据集在提升跨语料泛化能力方面的适用性。
  • 提出并验证新方法——具体为使用 LibriAll 语料库和减小 STFT 帧移——以提升在多样化录音条件下的鲁棒性。

提出的方法

  • 本研究评估在多种语料库(包括 LibriSpeech、VoxCeleb、TIMIT 和 IEEE)上训练的深度神经网络(DNN)模型,并在未见语料上测试其泛化能力。
  • 在对数谱域中应用信道归一化技术——倒谱均值减除(CMS)和 RASTA 滤波——以缓解信道失配的影响。
  • 在短时处理流程中引入更小的 STFT 帧移(4 ms),以提升时间分辨率和模型鲁棒性。
  • 使用改进的损失函数以增强模型泛化能力,但其在低 SNR 条件下的效果有限。
  • 评估了从多样化声学环境的众包录音中构建的 LibriAll 语料库作为更优训练资源的性能。
  • 在无混响数据上训练模型,并使用真实房间脉冲响应(RIR)在混响-噪声条件下测试其鲁棒性。

实验结果

研究问题

  • RQ1为何基于 DNN 的语音增强模型在低 SNR 水平下无法泛化到未见语音语料?
  • RQ2训练与测试语料之间的信道失配在语音增强中导致泛化差距的程度有多大?
  • RQ3传统信道归一化技术(如 CMS、RASTA)在提升监督语音增强中跨语料泛化能力方面的有效性如何?
  • RQ4哪些公开可用的语音语料库在提升跨语料泛化能力方面最有效,原因是什么?
  • RQ5减小 STFT 帧移是否能改善跨语料泛化能力,其性能增益与语料选择相比如何?

主要发现

  • 跨语料泛化能力差的主要原因是训练与测试语料之间的信道失配,尤其在低 SNR 条件下尤为显著。
  • 传统信道归一化技术(CMS 和 RASTA)虽能提升在未见语料上的性能,但增益有限,尤其在低 SNR 条件下。
  • 使用 LibriAll 语料库进行训练,可在 -5 dB SNR 条件下使 IEEE Male 的 STOI 提升 8.1%,IEEE Female 提升 5.3%,显著优于 VoxCeleb 等其他语料库。
  • 将 STFT 帧移减小至 4 ms,可在 -5 dB SNR 条件下使 TIMIT 的 STOI 提升 3.5%,IEEE Male 提升 1.8%,IEEE Female 提升 3.5%,表现出显著增益。
  • LibriAll 与 4 ms 帧移的结合在 -5 dB 条件下使 WSJ 的 STOI 达到 70.8%,IEEE Female 达到 63.7%,接近同语料训练的性能(分别为 62.8% 和 65.3%)。
  • 在混响-噪声条件下,使用 LibriAll 和 4 ms 帧移训练的模型表现最佳,IEEE Female 的 STOI 达到 70.3%,PESQ 达到 1.94,表现出对混响和噪声的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。