Skip to main content
QUICK REVIEW

[论文解读] Dynamic Attention Based Generative Adversarial Network with Phase Post-Processing for Speech Enhancement

Andong Li, Chengshi Zheng|arXiv (Cornell University)|Jun 13, 2020
Speech and Audio Processing参考文献 19被引用 4
一句话总结

该论文提出 DARGAN,一种基于动态注意力机制的生成对抗网络,结合递归学习与相位后处理,用于时频域语音增强。通过递归生成器迭代优化噪声特征,利用动态注意力机制自适应重加权特征,并采用深度 Griffin-Lim 算法进行相位重建,DARGAN 在 Voice Bank 语料库上实现了最先进性能,在 PESQ、CSIG、CBAK 和 COVL 指标上均优于先前的 GAN 及非 GAN 模型。

ABSTRACT

The generative adversarial networks (GANs) have facilitated the development of speech enhancement recently. Nevertheless, the performance advantage is still limited when compared with state-of-the-art models. In this paper, we propose a powerful Dynamic Attention Recursive GAN called DARGAN for noise reduction in the time-frequency domain. Different from previous works, we have several innovations. First, recursive learning, an iterative training protocol, is used in the generator, which consists of multiple steps. By reusing the network in each step, the noise components are progressively reduced in a step-wise manner. Second, the dynamic attention mechanism is deployed, which helps to re-adjust the feature distribution in the noise reduction module. Third, we exploit the deep Griffin-Lim algorithm as the module for phase postprocessing, which facilitates further improvement in speech quality. Experimental results on Voice Bank corpus show that the proposed GAN achieves state-of-the-art performance than previous GAN- and non-GAN-based models

研究动机与目标

  • 为解决现有基于 GAN 的语音增强模型在相位估计与特征表示方面的局限性。
  • 通过新型深度学习架构提升低信噪比与不稳定噪声环境下的语音质量与可懂度。
  • 通过引入专用的相位后处理步骤,克服仅基于幅度谱估计常见的相位失配问题。
  • 通过递归训练与动态注意力机制增强特征学习与噪声抑制能力。
  • 在基于 GAN 与非 GAN 的语音增强模型中,实现客观指标上的最先进性能。

提出的方法

  • 生成器采用递归学习机制,将噪声抑制过程分解为多个阶段,每个阶段通过记忆机制对前一阶段的输出进行迭代优化。
  • 在噪声抑制模块中集成动态注意力机制,自适应重加权特征图,提升表征学习与噪声抑制效果。
  • 采用最小二乘 GAN(LS-GAN)与条件 GAN(cGAN)进行训练,其中生成器将含噪谱图映射为增强后的谱图。
  • 相位后处理通过深度 Griffin-Lim 算法(DGLA)实现,通过多次展开优化模块,迭代优化相位。
  • 训练目标结合对抗损失与 L1 正则化损失,超参数 λG 控制感知质量与重建保真度之间的权衡。
  • 判别器被训练以区分真实干净谱图与生成的增强谱图,从而促使生成器输出更具真实感的结果。

实验结果

研究问题

  • RQ1生成器中的递归学习是否能通过迭代优化噪声特征提升语音增强性能?
  • RQ2动态注意力机制的引入是否能在时频域中实现更优的特征表征与噪声抑制?
  • RQ3通过深度 Griffin-Lim 实现的相位后处理是否能显著改善语音质量,从而纠正仅基于幅度估计的相位失配?
  • RQ4所提出的 DARGAN 模型在客观指标上与最先进基于 GAN 与非 GAN 的语音增强模型相比表现如何?
  • RQ5在训练目标中,对抗损失与 L1 正则化损失之间的最优权衡是什么,以最大化语音质量?

主要发现

  • 当 λG = 1 时,DARGAN 的 PESQ 得分为 2.93,CSIG 得分为 4.30,相比 SEGAN 在 PESQ 上提升 0.80,在 CSIG 上提升 0.81。
  • 该模型在 PESQ 上较近期的 SOTA 非 GAN 模型 MetricGAN 提升 0.07,在 CSIG 上提升 0.08。
  • 采用 DGLA 的相位后处理(PPP)使 PESQ 提升 0.03,CBAK 提升 0.02,证明其在相位优化方面的有效性。
  • 最佳性能出现在 λG = 1 时,进一步增加该参数会导致 L1 损失过强,从而降低性能。
  • DARGAN 在所有四项指标上均优于 STFT-TCN(DNS-Challenge 排名模型),证实其在真实噪声环境下的优越性。
  • 可视化分析表明,与 SEGAN 相比,DARGAN 更有效地抑制了残留噪声,同时更好地保留了共振峰结构与语音细节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。