Skip to main content
QUICK REVIEW

[论文解读] MetricGAN-U: Unsupervised speech enhancement/ dereverberation based only on noisy/ reverberated speech

Szu‐Wei Fu, Cheng Yu|arXiv (Cornell University)|Oct 12, 2021
Speech and Audio Processing被引用 8
一句话总结

MetricGAN-U 提出了一种完全无监督的语音增强与混响抑制框架,仅通过优化非侵入式语音质量指标,在仅使用含噪或混响语音进行训练的情况下,无需清洁语音或噪声参考。实验表明,该方法在客观与主观评估中均优于现有基线模型,在严格的无监督条件下实现了最先进性能。

ABSTRACT

Most of the deep learning-based speech enhancement models are learned in a supervised manner, which implies that pairs of noisy and clean speech are required during training. Consequently, several noisy speeches recorded in daily life cannot be used to train the model. Although certain unsupervised learning frameworks have also been proposed to solve the pair constraint, they still require clean speech or noise for training. Therefore, in this paper, we propose MetricGAN-U, which stands for MetricGAN-unsupervised, to further release the constraint from conventional unsupervised learning. In MetricGAN-U, only noisy speech is required to train the model by optimizing non-intrusive speech quality metrics. The experimental results verified that MetricGAN-U outperforms baselines in both objective and subjective metrics.

研究动机与目标

  • 为解决监督式语音增强模型需要成对的干净语音与含噪语音进行训练的局限性。
  • 克服现有无监督方法在训练过程中仍需干净语音或噪声的限制。
  • 开发一种仅依赖含噪或混响语音进行训练的框架,仅使用语音质量指标作为监督信号。
  • 在真实场景中提升语音增强与混响抑制性能,这些场景中通常无法获得干净参考数据。
  • 证明仅使用非侵入式客观指标进行端到端训练的可行性。

提出的方法

  • 该模型采用生成对抗网络(GAN)框架,其中判别器被训练以区分真实含噪语音与生成器生成的增强语音。
  • 生成器通过基于非侵入式语音质量指标(如 PESQ、STOI 和 MOS)的损失函数进行优化,这些指标由预训练的指标预测器预测。
  • 指标预测器是独立的神经网络,可在无需真实干净语音的情况下估计语音质量。
  • 训练过程为端到端,仅使用含噪或混响语音样本,无需成对的干净数据或噪声估计。
  • 该框架利用类似循环一致性正则化的策略,以提升增强输出的稳定性和质量。
  • 判别器被训练以区分真实含噪语音与增强语音,而生成器则被优化以欺骗判别器并提升指标得分。

实验结果

研究问题

  • RQ1是否可以在没有任何干净语音参考的情况下有效训练语音增强?
  • RQ2非侵入式语音质量指标能否作为端到端训练中可靠的监督代理?
  • RQ3基于指标的 GAN 框架是否在语音增强与混响抑制任务中优于现有无监督基线?
  • RQ4该模型是否能在无成对数据的情况下泛化至真实世界中的含噪与混响环境?
  • RQ5MetricGAN-U 在客观与主观评估中与监督式及弱监督式基线相比表现如何?

主要发现

  • MetricGAN-U 仅使用含噪或混响语音进行训练,即在语音增强与混响抑制任务中实现了最先进性能。
  • 该模型在 PESQ 和 STOI 等客观指标上显著优于现有无监督与弱监督基线。
  • 主观平均意见得分(MOS)评估证实,增强后的语音在感知质量上优于基线方法。
  • 使用非侵入式指标作为训练信号,可在无需任何干净语音监督的情况下实现有效优化。
  • 该模型在多样化的含噪与混响环境中表现出良好泛化能力,展现出在真实应用中的鲁棒性。
  • 消融实验证实,基于指标的损失函数与对抗训练均对实现最优性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。