[论文解读] TSTNN: Two-stage Transformer based Neural Network for Speech Enhancement in the Time Domain
本文提出TSTNN,一种基于两阶段Transformer的神经网络,用于时域端到端语音增强。它采用堆叠的两阶段Transformer模块提取局部和全局特征,通过掩码模块优化表征,并利用解码器重建干净语音,在基准数据集上实现了显著降低模型复杂度的最先进性能。
In this paper, we propose a transformer-based architecture, called two-stage transformer neural network (TSTNN) for end-to-end speech denoising in the time domain. The proposed model is composed of an encoder, a two-stage transformer module (TSTM), a masking module and a decoder. The encoder maps input noisy speech into feature representation. The TSTM exploits four stacked two-stage transformer blocks to efficiently extract local and global information from the encoder output stage by stage. The masking module creates a mask which will be multiplied with the encoder output. Finally, the decoder uses the masked encoder feature to reconstruct the enhanced speech. Experimental results on the benchmark dataset show that the TSTNN outperforms most state-of-the-art models in time or frequency domain while having significantly lower model complexity.
研究动机与目标
- 开发一种低复杂度、直接在时域运行的端到端语音增强模型。
- 通过有效捕捉噪声语音中的局部和全局时间依赖关系,提升语音质量和可懂度。
- 与现有的基于Transformer或CNN的语音增强架构相比,降低模型复杂度。
- 在时域和频域的最先进模型中,实现具有竞争力或更优的性能。
提出的方法
- 模型架构由编码器、两阶段Transformer模块(TSTM)、掩码模块和解码器组成。
- TSTM采用四个堆叠的两阶段Transformer模块,从编码器输出中逐步提取分层表征。
- 每个两阶段Transformer模块分两个阶段处理特征:首先捕捉局部上下文,然后通过自注意力机制建模长程依赖。
- 掩码模块生成一个时域掩码,与编码器输出逐元素相乘,以抑制噪声分量。
- 解码器使用转置卷积从掩码后的特征表征中重建增强语音信号。
- 整个网络通过最小化增强语音与干净语音波形之间差异的损失函数进行端到端训练。
实验结果
研究问题
- RQ1两阶段Transformer架构是否能有效建模噪声语音中的局部与全局时间模式,以实现时域增强?
- RQ2所提出的TSTNN在客观指标方面是否优于现有最先进模型?
- RQ3两阶段设计在保持或提升性能的同时,能在多大程度上降低模型复杂度?
- RQ4掩码模块在噪声抑制和语音重建保真度方面有何贡献?
主要发现
- 在基准数据集上,TSTNN在PESQ和STOI等客观语音质量指标方面达到最先进性能。
- 与时域中的CNN基线和Transformer基线相比,TSTNN在噪声抑制和语音重建质量方面表现更优。
- TSTNN在参数量和FLOPs方面显著低于同类Transformer模型,实现了更低的模型复杂度。
- 消融实验证实,两阶段设计有助于提升特征表征学习,从而带来更好的增强性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。