Skip to main content
QUICK REVIEW

[论文解读] Nonlinear Residual Echo Suppression Based on Multi-stream Conv-TasNet

Hongsheng Chen, Teng Xiang|arXiv (Cornell University)|May 15, 2020
Speech and Audio Processing参考文献 23被引用 4
一句话总结

该论文提出了一种基于多流Conv-TasNet的残余回声抑制(RES)方法,通过将线性AEC系统的残余信号和自适应滤波器输出作为双输入流,以增强回声抑制效果。通过整合多输入卷积模块和指数层归一化,该模型在单人说话和双人说话场景下均表现出色,双人说话条件下回声返回损耗增强(ERLE)超过45 dB,信噪比增益(SDR)超过13 dB。

ABSTRACT

Acoustic echo cannot be entirely removed by linear adaptive filters due to the nonlinear relationship between the echo and far-end signal. Usually a post processing module is required to further suppress the echo. In this paper, we propose a residual echo suppression method based on the modification of fully convolutional time-domain audio separation network (Conv-TasNet). Both the residual signal of the linear acoustic echo cancellation system, and the output of the adaptive filter are adopted to form multiple streams for the Conv-TasNet, resulting in more effective echo suppression while keeping a lower latency of the whole system. Simulation results validate the efficacy of the proposed method in both single-talk and double-talk situations.

研究动机与目标

  • 解决线性声学回声消除(LAEC)在处理非线性回声路径时的局限性。
  • 克服传统RES方法中残余回声抑制与近端语音失真之间的权衡。
  • 利用深度学习建模残余回声抑制中的复杂非线性关系。
  • 通过利用自适应滤波器输出的辅助信息,提升语音质量和回声抑制效果。
  • 开发一种低延迟、端到端时域解决方案,优于频域方法和基于循环神经网络的方法。

提出的方法

  • 将Conv-TasNet架构改进为处理两个输入流:LAEC残余信号 $s_{\text{AEC}}(n)$ 和自适应滤波器输出 $\hat{d}(n)$。
  • 在时间卷积网络(TCN)中引入多输入卷积(MI Conv)模块,联合建模两个输入流的特征。
  • 用指数层归一化(eLN)替代累积层归一化(cLN),以稳定训练并提升泛化能力。
  • 修改训练目标,强调近端语音恢复并抑制残余回声,打破标准语音分离任务中的信道平衡性。
  • 使用一维卷积编码器将波形映射为嵌入表示,随后通过基于TCN的抑制模块和转置卷积解码器实现波形重建。
  • 采用端到端训练策略,损失函数针对语音质量和回声抑制进行优化,避免STFT方法固有的相位重建问题。

实验结果

研究问题

  • RQ1将LAEC残余信号与自适应滤波器输出作为双流输入,是否能相比单流模型提升残余回声抑制性能?
  • RQ2多输入卷积模块的引入是否能增强模型抑制非线性残余回声的能力,同时保持近端语音质量?
  • RQ3与传统RES方法(如FCN、BLSTM)相比,所提方法在回声抑制和语音质量指标上的表现如何?
  • RQ4与非因果RNN方法(如BLSTM)相比,该方法在延迟方面降低了多少?
  • RQ5在近端语音能量比高的双人说话场景下,改进后的Conv-TasNet架构是否优于标准Conv-TasNet?

主要发现

  • 所提出的多流Conv-TasNet(TasNet-MI)在单人说话场景下对语音和音乐的回声返回损耗增强(ERLE)均超过45 dB,显著优于FCN(16.55 dB)和BLSTM(语音:51.67 dB)。
  • 在双人说话条件下(SER为-14.2 dB),TasNet-MI的语音PESQ为2.80,SDR为13.8 dB,优于TasNet-L(PESQ:2.71,SDR:12.6 dB)和TasNet-O(PESQ:2.57,SDR:11.7 dB)。
  • 对于远端音乐信号(SER为-18.2 dB),TasNet-MI的STOI为0.820,优于TasNet-L(0.800)和TasNet-O(0.773),表明语音可懂度得到提升。
  • 由于采用完全卷积且因果的架构,模型保持了低延迟,避免了非因果BLSTM方法带来的高延迟问题。
  • 引入MI Conv模块和eLN后,在双人说话语音条件下,SDR相比TasNet-O提升1.1 dB,相比TasNet-L提升2.2 dB。
  • 在双人说话语音条件下,相比仅使用LAEC处理,该方法实现了13.8 dB的SDR增益,证明了在不降低近端语音质量的前提下实现了有效的回声抑制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。