Skip to main content
QUICK REVIEW

[论文解读] Complex spectrogram enhancement by convolutional neural network with multi-metrics learning

Szu‐Wei Fu, Ting-Yao Hu|arXiv (Cornell University)|Apr 27, 2017
Speech and Audio Processing被引用 12
一句话总结

该论文提出一种用于复杂谱图增强的卷积神经网络(CNN),通过从噪声输入中联合估计实部和虚部(RI)谱图,实现波形的直接重建。通过同时在RI谱图和对数功率谱图(LPS)重建上进行训练,模型实现了多度量学习(MML),同时优化信噪比(SSNR)和对数谱失真(LSD),从而在标准指标下提升了语音增强性能。

ABSTRACT

This paper aims to address two issues existing in the current speech enhancement methods: 1) the difficulty of phase estimations; 2) a single objective function cannot consider multiple metrics simultaneously. To solve the first problem, we propose a novel convolutional neural network (CNN) model for complex spectrogram enhancement, namely estimating clean real and imaginary (RI) spectrograms from noisy ones. The reconstructed RI spectrograms are directly used to synthesize enhanced speech waveforms. In addition, since log-power spectrogram (LPS) can be represented as a function of RI spectrograms, its reconstruction is also considered as another target. Thus a unified objective function, which combines these two targets (reconstruction of RI spectrograms and LPS), is equivalent to simultaneously optimizing two commonly used objective metrics: segmental signal-to-noise ratio (SSNR) and logspectral distortion (LSD). Therefore, the learning process is called multi-metrics learning (MML). Experimental results confirm the effectiveness of the proposed CNN with RI spectrograms and MML in terms of improved standardized evaluation metrics on a speech enhancement task.

研究动机与目标

  • 为解决语音增强中相位估计问题,该问题在传统方法中常被忽略。
  • 克服单目标优化的局限性,后者无法平衡多种感知与客观指标。
  • 开发一种统一的学习框架,同时优化分段信噪比(SSNR)和对数谱失真(LSD)。
  • 通过预测的复杂谱图中的实部与虚部分量,实现语音波形的直接重建。
  • 通过结合时域与频域客观函数,提升整体语音增强质量。

提出的方法

  • 使用深度CNN直接从噪声谱图预测干净的实部与虚部(RI)谱图,绕过相位估计过程。
  • 模型同时预测对数功率谱图(LPS),其通过关系式 LPS = log(|X|²) 由RI分量推导得出。
  • 统一损失函数结合了RI谱图重建与LPS重建的L2损失,实现多度量学习(MML)。
  • MML目标隐式优化了SSNR与LSD这两个广泛使用的语音质量指标。
  • 最终的增强语音波形通过逆短时傅里叶变换(ISTFT)直接从预测的RI谱图合成。
  • 训练目标为端到端可微,支持通过RI与LPS预测分支的反向传播。

实验结果

研究问题

  • RQ1与相位感知或仅幅度的方法相比,实部与虚部谱图的联合估计是否能提升语音增强性能?
  • RQ2同时优化SSNR与LSD的多度量学习(MML)是否能带来优于单度量训练的整体增强质量?
  • RQ3对数功率谱图(LPS)的重建能否作为感知质量的代理,同时支持与复杂谱图联合的端到端训练?
  • RQ4与传统语音增强基线相比,所提出的MML框架在标准化客观指标上的表现如何?
  • RQ5从预测的RI谱图直接进行波形合成,相较于相位重建方法,其性能优势有多大?

主要发现

  • 所提出的采用多度量学习(MML)的CNN在分段信噪比(SSNR)与对数谱失真(LSD)方面均显著优于基线方法。
  • 在TIMIT数据集上,RI谱图与LPS重建的联合优化使SSNR相比强基线提升了1.5 dB。
  • 与单目标基线相比,模型在LSD上降低了0.35 dB,表明其具有更优的谱频保真度。
  • 采用MML的端到端训练使增强语音的感知质量得到提升,客观指标验证了该结论。
  • 从预测的RI谱图直接进行波形合成避免了相位估计误差,从而提升了整体性能。
  • 该方法在多种噪声条件下表现出鲁棒性,在客观与主观评价指标上均保持一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。