[论文解读] Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement
本文提出 DB-AIAT,一种用于单通道语音增强的双分支变换器架构,通过掩码分支独立估计幅度谱,并通过互补的优化分支细化复数谱细节。通过整合注意力机制中的注意力变换器(AIAT)以建模长程时频依赖关系,该方法在 Voice Bank + DEMAND 数据集上仅使用 2.81M 参数即实现了最先进性能(PESQ 3.31,STOI 95.6%,SSNR 10.79 dB)。
Curriculum learning begins to thrive in the speech enhancement area, which decouples the original spectrum estimation task into multiple easier sub-tasks to achieve better performance. Motivated by that, we propose a dual-branch attention-in-attention transformer dubbed DB-AIAT to handle both coarse- and fine-grained regions of the spectrum in parallel. From a complementary perspective, a magnitude masking branch is proposed to coarsely estimate the overall magnitude spectrum, and simultaneously a complex refining branch is elaborately designed to compensate for the missing spectral details and implicitly derive phase information. Within each branch, we propose a novel attention-in-attention transformer-based module to replace the conventional RNNs and temporal convolutional networks for temporal sequence modeling. Specifically, the proposed attention-in-attention transformer consists of adaptive temporal-frequency attention transformer blocks and an adaptive hierarchical attention module, aiming to capture long-term temporal-frequency dependencies and further aggregate global hierarchical contextual information. Experimental results on Voice Bank + DEMAND demonstrate that DB-AIAT yields state-of-the-art performance (e.g., 3.31 PESQ, 95.6% STOI and 10.79dB SSNR) over previous advanced systems with a relatively small model size (2.81M).
研究动机与目标
- 通过将幅度和相位恢复解耦为互补分支,提升单通道语音增强性能。
- 解决 RNN 和 TCN 在建模长程时频依赖关系方面的局限性。
- 通过联合估计幅度谱并优化复数谱细节,提升语音的感知质量和可懂度。
- 通过轻量级、基于注意力的架构,在保持或提升性能的同时降低模型复杂度。
提出的方法
- 该方法采用双分支架构:幅度掩码分支(MMB)用于粗粒度幅度谱估计,复数优化分支(CRB)用于细粒度谱细节恢复。
- 每个分支均使用注意力机制中的注意力变换器(AIAT)模块,以在时间与频率轴上建模长程依赖关系。
- AIAT 模块由自适应时频注意力模块和自适应分层注意力(AHA)模块组成,用于聚合全局上下文信息。
- 分支间跳跃连接实现特征融合,将 MMB 的粗估计与 CRB 的优化细节结合,以重建干净的复数谱。
- 网络通过联合使用 L1 损失和感知损失函数进行端到端训练,以优化语音质量与可懂度。
- 模型采用密集编码-解码结构并结合残差连接,以稳定训练并提升特征表示能力。

实验结果
研究问题
- RQ1是否可通过将幅度估计与复数谱优化分离的双分支架构,提升语音增强性能?
- RQ2与 RNN 和 TCN 相比,注意力机制中的注意力变换器(AIAT)在建模长程时频依赖关系方面效果如何?
- RQ3幅度掩码与复数优化分支的互补设计是否优于单分支方法?
- RQ4自适应分层注意力模块在变换器架构中对全局上下文聚合的增强程度如何?
- RQ5轻量级基于变换器的模型是否能在参数量少于现有 SOTA 系统的前提下实现 SOTA 性能?
主要发现
- DB-AIAT 在 Voice Bank + DEMAND 数据集上取得 PESQ 3.31、STOI 95.6% 和 SSNR 10.79 dB 的成绩,优于所有先前的 SOTA 方法。
- 双分支设计在所有指标上均带来一致提升:相比最强基线 DEMUCS,PESQ 提升 +0.24,STOI 提升 +0.6%,CSIG 提升 +0.30,CBAK 提升 +0.35,COVL 提升 +0.33。
- 仅使用 CRB-AIAT 变体即在 DCCRN 基础上实现 PESQ 提升 0.47 和 CSIG 提升 0.60,证明了 AIAT 模块的有效性。
- 同时包含双分支的完整 DB-AIAT 模型性能最佳,证实了幅度与复数优化分支之间的互补优势。
- AIAT 模块显著提升性能:DB-AIAT 相较于无 AHA 的 DB-ATFAT 模型,COVL 提升 +0.39,CBAK 提升 +0.39,验证了分层注意力机制的关键作用。
- 仅使用 2.81M 参数,DB-AIAT 在保持 SOTA 性能的同时,相比竞争模型显著提升了参数效率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。