[论文解读] Multichannel Speech Enhancement by Raw Waveform-mapping using Fully Convolutional Networks
本文提出SDFCN与rSDFCN,一种基于Sinc卷积与空洞卷积的全卷积网络,直接在时域对多通道语音增强任务进行建模。通过跳过谱估计步骤,该方法在双通道耳内麦克风与分布式麦克风设置下实现了卓越的去噪性能,残差连接的引入进一步提升了结果。
In recent years, waveform-mapping-based speech enhancement (SE) methods have garnered significant attention. These methods generally use a deep learning model to directly process and reconstruct speech waveforms. Because both the input and output are in waveform format, the waveform-mapping-based SE methods can overcome the distortion caused by imperfect phase estimation, which may be encountered in spectral-mapping-based SE systems. So far, most waveform-mapping-based SE methods have focused on single-channel tasks. In this paper, we propose a novel fully convolutional network (FCN) with Sinc and dilated convolutional layers (termed SDFCN) for multichannel SE that operates in the time domain. We also propose an extended version of SDFCN, called the residual SDFCN (termed rSDFCN). The proposed methods are evaluated on two multichannel SE tasks, namely the dual-channel inner-ear microphones SE task and the distributed microphones SE task. The experimental results confirm the outstanding denoising capability of the proposed SE systems on both tasks and the benefits of using the residual architecture on the overall SE performance.
研究动机与目标
- 为解决基于谱映射的语音增强方法的局限性,特别是相位估计误差问题,提出一种时域波形映射方法。
- 将波形映射技术从单通道扩展至多通道场景,实现在复杂声学环境下的鲁棒语音增强。
- 设计一种结合Sinc卷积与空洞卷积的全卷积网络架构,实现高效且有效的多通道语音增强。
- 在两种不同的多通道语音增强任务上评估所提方法:耳内麦克风与分布式麦克风。
- 研究残差连接对波形映射模型性能与稳定性的影响。
提出的方法
- 所提出的SDFCN采用Sinc卷积层,直接从原始波形中学习最优滤波器组,实现参数高效的谱建模。
- 引入空洞卷积以扩大感受野而不增加参数量,使网络能够捕捉长程时间依赖关系。
- 残差SDFCN(rSDFCN)集成跳跃连接,以改善梯度流动与训练稳定性,增强深层网络中的特征学习能力。
- 模型直接在时域处理多通道输入波形,避免了谱域方法固有的相位估计误差。
- 未使用多头注意力机制;相反,该方法依赖空洞卷积与Sinc卷积的分层特征学习能力,实现鲁棒的增强效果。
- 采用原始波形与增强波形之间的均方误差损失,进行端到端训练。
实验结果
研究问题
- RQ1基于Sinc卷积与空洞卷积的全卷积网络能否在时域中有效实现多通道语音增强?
- RQ2在多通道数据上,所提出的SDFCN架构与现有波形映射模型相比,其去噪性能如何?
- RQ3残差连接对多通道设置下波形映射模型的性能与收敛性有何影响?
- RQ4在双通道耳内麦克风与分布式麦克风任务中,所提方法是否在语音质量与可懂度方面优于传统的谱映射系统?
- RQ5Sinc卷积与空洞卷积的设计能否在保持或提升增强精度的同时减少参数量?
主要发现
- 所提出的SDFCN在双通道耳内麦克风与分布式麦克风任务上均显著提升了语音质量与噪声抑制效果。
- rSDFCN变体优于基础SDFCN,表明残差连接能增强模型稳定性与性能。
- 与最先进谱映射系统相比,该方法取得了具有竞争力的结果,尤其在保持语音可懂度与减少伪影方面表现优异。
- Sinc卷积的使用使网络能够直接从原始波形中学习最优滤波响应,提升了建模效率。
- 空洞卷积层有效捕捉了长程时间依赖关系,同时未增加模型复杂度。
- 在原始波形上进行端到端训练,消除了对相位重建的需求,从而降低了增强输出中的失真。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。