[论文解读] DF-Conformer: Integrated architecture of Conv-TasNet and Conformer using linear complexity self-attention for speech enhancement
本文提出 DF-Conformer,一种新颖的语音增强模型,将 Conformer 模块与扩张深度可分离卷积整合到时域掩码预测网络中,并采用线性复杂度自注意力机制(FAVOR+)以保持计算效率。该模型在保持低推理延迟的同时,实现了比 TDCN++ 更高的尺度不变信噪比提升,展现出卓越的性能与可扩展性。
Single-channel speech enhancement (SE) is an important task in speech processing. A widely used framework combines an analysis/synthesis filterbank with a mask prediction network, such as the Conv-TasNet architecture. In such systems, the denoising performance and computational efficiency are mainly affected by the structure of the mask prediction network. In this study, we aim to improve the sequential modeling ability of Conv-TasNet architectures by integrating Conformer layers into a new mask prediction network. To make the model computationally feasible, we extend the Conformer using linear complexity attention and stacked 1-D dilated depthwise convolution layers. We trained the model on 3,396 hours of noisy speech data, and show that (i) the use of linear complexity attention avoids high computational complexity, and (ii) our model achieves higher scale-invariant signal-to-noise ratio than the improved time-dilated convolution network (TDCN++), an extended version of Conv-TasNet.
研究动机与目标
- 通过将 Conformer 架构整合到 Conv-TasNet 的掩码预测网络中,提升时域语音增强中的序列建模能力。
- 通过采用线性复杂度注意力机制(FAVOR+),解决标准多头自注意力在长序列中计算成本过高的问题。
- 通过结合扩张深度可分离卷积与 Conformer 模块,增强局部与全局时序建模能力。
- 在计算成本与现有 SOTA 模型相当的前提下,实现语音增强的最先进性能。
- 通过客观指标与注意力可视化,验证混合架构的有效性。
提出的方法
- 将 Conformer 模块集成到 TDCN++ 的掩码预测网络中,用 FAVOR+ 替代标准注意力机制以实现线性复杂度。
- 使用一维扩张深度可分离卷积层扩展感受野,提升局部序列建模能力。
- 采用可学习的分析/合成滤波器组,实现端到端的时域语音增强。
- 应用实例归一化与可学习缩放参数以稳定训练,与 TDCN++ 类似。
- 通过正交随机特征实现 FAVOR+ 注意力,将自注意力复杂度从 O(n²) 降低至 O(n)。
- 在 3,396 小时的带噪语音数据上使用标准语音增强损失函数进行模型训练。
实验结果
研究问题
- RQ1将 Conformer 模块集成到基于 Conv-TasNet 的架构中,能否提升语音增强性能?
- RQ2使用线性复杂度自注意力(FAVOR+)是否能在不增加计算成本的前提下实现有效的长距离建模?
- RQ3扩张卷积与 Conformer 模块的结合,如何影响时域语音增强中的局部与全局序列建模?
- RQ4所提出的架构能否在保持低推理时间的同时,实现优于 TDCN++ 的性能?
- RQ5DF-Conformer 中的注意力模式如何反映模型区分语音与噪声的能力?
主要发现
- DF-Conformer-8 实现了 14.43 dB 的尺度不变信噪比提升(SI-SNRi),优于 TDCN++(14.10 dB)与 Conv-Tasformer(14.36 dB),且计算成本相当。
- FAVOR+ 注意力的使用在降低计算复杂度的同时保持了高性能,使更大模型如 iDF-Conformer-12 达到 15.93 dB 的 SI-SNRi。
- DF-Conformer 的注意力矩阵显示,浅层网络全局关注以捕捉噪声与语音特征,深层网络则利用局部结构细化掩码。
- 将一维扩张深度可分离卷积(1D-DDC)与 FAVOR+ 注意力结合,在不增加实时因子(RTF)的前提下提升了性能,DF-Conformer-8 的 RTF ≈ 0.13。
- iDF-Conformer-12 实现了 15.93 dB 的 SI-SNRi 与 88.4% 的 ESTOI,展现出随模型规模增强的强可扩展性。
- 可视化分析表明,DF-Conformer 中的注意力头不仅聚焦于局部帧,还学习了序列中多样的注意力模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。