[论文解读] Nonlinear Residual Echo Suppression Based on Multi-stream Conv-TasNet
该论文提出了一种基于多流Conv-TasNet的残余回声抑制(RES)方法,通过将线性AEC系统的残余信号和自适应滤波器输出作为双输入流,以增强回声抑制效果。通过整合多输入卷积模块和指数层归一化,该模型在单人说话和双人说话场景下均表现出色,双人说话条件下回声返回损耗增强(ERLE)超过45 dB,信噪比增益(SDR)超过13 dB。
Acoustic echo cannot be entirely removed by linear adaptive filters due to the nonlinear relationship between the echo and far-end signal. Usually a post processing module is required to further suppress the echo. In this paper, we propose a residual echo suppression method based on the modification of fully convolutional time-domain audio separation network (Conv-TasNet). Both the residual signal of the linear acoustic echo cancellation system, and the output of the adaptive filter are adopted to form multiple streams for the Conv-TasNet, resulting in more effective echo suppression while keeping a lower latency of the whole system. Simulation results validate the efficacy of the proposed method in both single-talk and double-talk situations.
研究动机与目标
- 解决线性声学回声消除(LAEC)在处理非线性回声路径时的局限性。
- 克服传统RES方法中残余回声抑制与近端语音失真之间的权衡。
- 利用深度学习建模残余回声抑制中的复杂非线性关系。
- 通过利用自适应滤波器输出的辅助信息,提升语音质量和回声抑制效果。
- 开发一种低延迟、端到端时域解决方案,优于频域方法和基于循环神经网络的方法。
提出的方法
- 将Conv-TasNet架构改进为处理两个输入流:LAEC残余信号 $s_{\text{AEC}}(n)$ 和自适应滤波器输出 $\hat{d}(n)$。
- 在时间卷积网络(TCN)中引入多输入卷积(MI Conv)模块,联合建模两个输入流的特征。
- 用指数层归一化(eLN)替代累积层归一化(cLN),以稳定训练并提升泛化能力。
- 修改训练目标,强调近端语音恢复并抑制残余回声,打破标准语音分离任务中的信道平衡性。
- 使用一维卷积编码器将波形映射为嵌入表示,随后通过基于TCN的抑制模块和转置卷积解码器实现波形重建。
- 采用端到端训练策略,损失函数针对语音质量和回声抑制进行优化,避免STFT方法固有的相位重建问题。
实验结果
研究问题
- RQ1将LAEC残余信号与自适应滤波器输出作为双流输入,是否能相比单流模型提升残余回声抑制性能?
- RQ2多输入卷积模块的引入是否能增强模型抑制非线性残余回声的能力,同时保持近端语音质量?
- RQ3与传统RES方法(如FCN、BLSTM)相比,所提方法在回声抑制和语音质量指标上的表现如何?
- RQ4与非因果RNN方法(如BLSTM)相比,该方法在延迟方面降低了多少?
- RQ5在近端语音能量比高的双人说话场景下,改进后的Conv-TasNet架构是否优于标准Conv-TasNet?
主要发现
- 所提出的多流Conv-TasNet(TasNet-MI)在单人说话场景下对语音和音乐的回声返回损耗增强(ERLE)均超过45 dB,显著优于FCN(16.55 dB)和BLSTM(语音:51.67 dB)。
- 在双人说话条件下(SER为-14.2 dB),TasNet-MI的语音PESQ为2.80,SDR为13.8 dB,优于TasNet-L(PESQ:2.71,SDR:12.6 dB)和TasNet-O(PESQ:2.57,SDR:11.7 dB)。
- 对于远端音乐信号(SER为-18.2 dB),TasNet-MI的STOI为0.820,优于TasNet-L(0.800)和TasNet-O(0.773),表明语音可懂度得到提升。
- 由于采用完全卷积且因果的架构,模型保持了低延迟,避免了非因果BLSTM方法带来的高延迟问题。
- 引入MI Conv模块和eLN后,在双人说话语音条件下,SDR相比TasNet-O提升1.1 dB,相比TasNet-L提升2.2 dB。
- 在双人说话语音条件下,相比仅使用LAEC处理,该方法实现了13.8 dB的SDR增益,证明了在不降低近端语音质量的前提下实现了有效的回声抑制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。