Skip to main content
QUICK REVIEW

[论文解读] A Recursive Network with Dynamic Attention for Monaural Speech Enhancement

Andong Li, Chengshi Zheng|arXiv (Cornell University)|Mar 29, 2020
Speech and Audio Processing参考文献 28被引用 6
一句话总结

该论文提出了一种具有动态注意力机制的递归网络(DARCN),用于单耳语音增强,将噪声抑制网络与独立的注意力生成器相结合,以自适应地控制特征流动。通过在多个阶段中利用递归学习和动态注意力调制复用单一网络,DARCN 在仅 123 万个参数的情况下实现了最先进的 PESQ 和 STOI 分数,展现出卓越的性能与参数效率。

ABSTRACT

A person tends to generate dynamic attention towards speech under complicated environments. Based on this phenomenon, we propose a framework combining dynamic attention and recursive learning together for monaural speech enhancement. Apart from a major noise reduction network, we design a separated sub-network, which adaptively generates the attention distribution to control the information flow throughout the major network. To effectively decrease the number of trainable parameters, recursive learning is introduced, which means that the network is reused for multiple stages, where the intermediate output in each stage is correlated with a memory mechanism. As a result, a more flexible and better estimation can be obtained. We conduct experiments on TIMIT corpus. Experimental results show that the proposed architecture obtains consistently better performance than recent state-of-the-art models in terms of both PESQ and STOI scores.

研究动机与目标

  • 通过将动态注意力与递归学习相结合,提升单耳语音增强的噪声抑制性能。
  • 在不牺牲性能的前提下,减少深度语音增强模型中的可训练参数数量。
  • 通过自适应注意力机制,提升模型在未见噪声条件下的泛化能力。
  • 解决深度神经网络在语音增强中因梯度消失和模型深度限制带来的问题。
  • 开发一种参数高效的架构,通过多阶段逐步优化估计结果。

提出的方法

  • 一个独立的注意力生成模块(AGM)在每个阶段动态生成注意力权重,调制主噪声抑制网络(NRM)中的特征流动。
  • 网络采用阶段递归神经网络(SRNN)架构,通过记忆机制在多个阶段中复用同一网络,以修正中间输出。
  • 注意力权重通过逐点卷积和 Sigmoid 激活函数应用,实现在 NRM 中对特征的自适应加权。
  • 模型采用多阶段训练范式,使用均方误差(MSE)损失和 Adam 优化器,配合早停和学习率衰减策略。
  • 该架构基于类似 U-Net 的编码器-解码器结构,结合残差连接与门控卷积,以实现鲁棒的谱估计。
  • 该框架在 TIMIT 语料库上进行训练与评估,采用 PESQ 和 STOI 指标衡量语音的感知质量与可懂度。

实验结果

研究问题

  • RQ1动态注意力能否通过自适应调节时频域子带中特征的重要性,从而提升语音增强性能?
  • RQ2通过参数复用实现的递归学习是否能在降低参数数量的同时提升模型深度与性能?
  • RQ3在已见与未见噪声条件下,该框架在 PESQ 与 STOI 指标上的表现与最先进模型相比如何?
  • RQ4在递归架构中,为平衡性能与过拟合,最优阶段数(Q)是多少?
  • RQ5该模型是否能在保持低参数量的同时,对未见噪声类型展现出良好的泛化能力?

主要发现

  • 在已见噪声情况下,所提出的 DARCN 模型相较于 CRN 基线,平均 PESQ 提升 0.16 分,STOI 提升 1.01%。
  • 在未见噪声情况下,DARCN 仍保持一致的性能增益,展现出强大的泛化能力。
  • 模型将可训练参数减少至 123 万个——显著低于 CRN(1758 万)、GRN(313 万)、DCN(292 万)和 SLSTM(3681 万)。
  • 随着阶段数(Q)增加,性能在 Q=3 之前持续提升,之后 PESQ 略有下降,原因在于 MSE 损失与感知指标之间存在冲突的优化目标。
  • 动态注意力机制通过自适应聚焦于相关频谱分量,实现了更优的噪声抑制,这从提升的 STOI 与 PESQ 分数中得到验证。
  • 递归学习机制在不增加额外参数的情况下有效加深了网络,增强了表征学习能力,同时保持了低延迟特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。