[论文解读] A Time-domain Monaural Speech Enhancement with Feedback Learning
该论文提出FTNet,一种基于反馈学习的时域单通道语音增强网络,通过减少参数量同时提升性能。通过将中间估计值递归反馈至分阶段循环网络(采用门控线性单元和卷积自编码器),FTNet在仅102万可训练参数下实现了最先进的PESQ和STOI得分,显著低于基线模型,展现出极高的参数效率与渐进式噪声抑制能力。
In this paper, we propose a type of neural network with feedback learning in the time domain called FTNet for monaural speech enhancement, where the proposed network consists of three principal components. The first part is called stage recurrent neural network, which is introduced to effectively aggregate the deep feature dependencies across different stages with a memory mechanism and also remove the interference stage by stage. The second part is the convolutional auto-encoder. The third part consists of a series of concatenated gated linear units, which are capable of facilitating the information flow and gradually increasing the receptive fields. Feedback learning is adopted to improve the parameter efficiency and therefore, the number of trainable parameters is effectively reduced without sacrificing its performance. Numerous experiments are conducted on TIMIT corpus and experimental results demonstrate that the proposed network can achieve consistently better performance in terms of both PESQ and STOI scores than two state-of-the-art time domain-based baselines in different conditions.
研究动机与目标
- 解决现有时域语音增强模型参数量过高和计算成本过大的问题。
- 通过轻量化循环架构提升在噪声环境下的语音质量和可懂度。
- 利用反馈学习在各阶段累积先验知识,实现对增强语音的渐进式优化。
- 在极低可训练参数量下实现卓越性能,提升模型效率,适用于实际部署。
提出的方法
- 网络采用分阶段循环神经网络(SRNN)通过记忆机制聚合多级增强阶段中的深层特征依赖关系。
- 通过将每阶段的估计输出递归反馈回网络作为先验,实现反馈学习,支持渐进式优化。
- 使用卷积自编码器(CAE)进行潜在空间中的特征提取与表征学习。
- 堆叠拼接门控线性单元(GLUs)以扩展感受野并高效控制信息流动。
- 采用多阶段损失函数进行端到端训练,同时优化感知质量和可懂度。
- 反馈机制使网络参数可在各阶段复用,显著降低总可训练参数量而无需性能损失。
实验结果
研究问题
- RQ1反馈学习是否能在不牺牲性能的前提下提升时域语音增强网络的参数效率?
- RQ2通过分阶段反馈实现的渐进式优化,对PESQ和STOI等语音质量与可懂度指标有何影响?
- RQ3具备反馈学习的轻量化网络在单通道语音增强任务中,能在多大程度上超越更深、参数更多的SOTA模型?
- RQ4各阶段累积的先验信息如何影响SRNN中的隐藏状态表征?
主要发现
- FTNet在可见与不可见噪声条件下,均持续优于两项SOTA时域基线模型的PESQ与STOI得分。
- 模型将可训练参数量减少至102万——远低于AECNN(631万)和RHR-Net(195万),展现出极高的参数效率。
- 通过反馈实现的渐进式优化带来显著性能提升:在-5dB SNR条件下,PESQ从第一阶段的1.06提升至第五阶段的1.83。
- 频谱可视化结果表明,噪声分量在各阶段逐步被抑制,后期阶段中更清晰的语音特征逐渐显现。
- 隐藏状态可视化显示,随着反馈阶段增加,SRNN表征变得愈发清晰且模糊度降低,表明有效学习了干净语音先验。
- 反馈机制通过阶段间参数复用,实现了28×Q层的有效网络深度,而无需增加参数量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。