Skip to main content
QUICK REVIEW

[论文解读] Joint Echo Cancellation and Noise Suppression based on Cascaded Magnitude and Complex Mask Estimation

Xiaofeng Shu, Yehang Zhu|arXiv (Cornell University)|Jul 20, 2021
Speech and Audio Processing参考文献 26被引用 9
一句话总结

该论文提出了一种级联的幅度与复数时序卷积神经网络(MC-TCN),用于联合进行声学回声消除(AEC)与噪声抑制(NS),通过先估计幅度掩码,再估计复数比掩码(CRM),以同时增强幅度与相位。该方法在 INTERSPEECH2021 AEC-Challenge 盲测数据集上取得了 4.41 的 DECMOS 评分,优于基线模型 0.54 分。

ABSTRACT

Acoustic echo and background noise can seriously degrade the intelligibility of speech. In practice, echo and noise suppression are usually treated as two separated tasks and can be removed with various digital signal processing (DSP) and deep learning techniques. In this paper, we propose a new cascaded model, magnitude and complex temporal convolutional neural network (MC-TCN), to jointly perform acoustic echo cancellation and noise suppression with the help of adaptive filters. The MC-TCN cascades two separation cores, which are used to extract robust magnitude spectra feature and to enhance magnitude and phase simultaneously. Experimental results reveal that the proposed method can achieve superior performance by removing both echo and noise in real-time. In terms of DECMOS, the subjective test shows our method achieves a mean score of 4.41 and outperforms the INTERSPEECH2021 AEC-Challenge baseline by 0.54.

研究动机与目标

  • 为解决在回声与噪声同时存在的真实场景中,单独处理 AEC 与 NS 所面临的局限性。
  • 通过深度学习联合建模回声与噪声抑制,提升语音质量与可懂度。
  • 开发一种轻量化、可并行化的架构,在单人说话与双人说话场景下均优于现有方法。
  • 在保持实时推理能力的同时,降低语音失真与残留回声。

提出的方法

  • MC-TCN 模型采用两级级联架构:第一阶段使用幅度 TCN 从输入谱图中估计幅度掩码。
  • 将估计出的幅度掩码与原始相位结合,形成复数输入,用于第二阶段。
  • 第二阶段采用复数值 TCN 估计复数比掩码(CRM),实现幅度与相位的联合增强。
  • 使用带有空洞卷积的时序卷积网络(TCNs),以扩展感受野并高效建模长程依赖关系。
  • 模型采用端到端训练,损失函数针对信号逼近进行优化,支持鲁棒的特征学习。
  • 系统中使用自适应滤波器以估计并抵消回声路径,提升实时环境下的回声抑制效果。

实验结果

研究问题

  • RQ1级联的深度学习架构是否能比独立处理的流水线更有效地联合抑制回声与噪声?
  • RQ2先进行幅度掩码估计,再进行复数掩码估计,如何提升语音增强性能?
  • RQ3基于 TCN 的模型在实时 AEC 与 NS 任务中,能否显著优于循环网络(如 LSTM)?
  • RQ4模型深度(块数)对语音质量与回声抑制的影响程度如何?
  • RQ5在双人说话场景下(近端与远端语音同时活动),该方法表现如何?

主要发现

  • 所提出的 MC-TCN 模型在 INTERSPEECH2021 AEC-Challenge 盲测数据集上取得 4.41 的 DECMOS 评分,整体排名第三。
  • 相比 AEC-Challenge 基线模型,DECMOS 提升 0.54 分,表明感知语音质量显著改善。
  • 在双人说话场景中,模型对劣化语音的 DECMOS 达 3.286,对回声的 MOS 达 3.968,表现出强鲁棒性。
  • 使用 20 个块(B=20)的模型在回声抑制与语音质量之间达到最佳平衡,优于 B=10 与 B=15 的配置。
  • 在 MacBook Pro 上,每帧推理时间仅为 0.7460ms,证实了其具备实时应用能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。