[论文解读] EchoFilter: End-to-End Neural Network for Acoustic Echo Cancellation
EchoFilter 提出了一种端到端的深度学习框架,用于声学回声消除(AEC),通过使用一维时间卷积、双向LSTM和局部注意力机制对原始音频波形进行处理,实现时间对齐。该方法集成了多任务学习与双Talk检测头,在非线性失真和背景噪声环境下实现了最先进的ERLE性能(高达59.32 dB)和PESQ性能(1.30)。
Acoustic Echo Cancellation (AEC) whose aim is to suppress the echo originated from acoustic coupling between loudspeakers and microphones, plays a key role in voice interaction. Linear adaptive filter (AF) is always used for handling this problem. However, since there would be some severe effects in real scenarios, such nonlinear distortions, background noises, and microphone clipping, it would lead to considerable residual echo, giving poor performance in practice. In this paper, we propose an end-to-end network structure for echo cancellation, which is directly done on time-domain audio waveform. It is transformed to deep representation by temporal convolution, and modelled by Long Short-Term Memory (LSTM) for considering temporal property. Since time delay and severe reverberation may exist at the near-end with respect to the far-end, a local attention is employed for alignment. The network is trained using multitask learning by employing an auxiliary classification network for double-talk detection. Experiments show the superiority of our proposed method in terms of the echo return loss enhancement (ERLE) for single-talk periods and the perceptual evaluation of speech quality (PESQ) score for double-talk periods in background noise and nonlinear distortion scenarios.
研究动机与目标
- 解决传统线性自适应滤波器在真实AEC场景中处理非线性失真、背景噪声和麦克风削峰时的局限性。
- 通过用深度神经网络替代传统回声估计方法,克服音频设备中非线性元件导致的残留回声。
- 通过集成专用的双Talk检测模块作为辅助任务,提升双Talk时段的性能。
- 实现直接在原始音频波形上进行端到端训练,以保留时间与频谱保真度,避免使用STFT等中间表示。
提出的方法
- 使用一维时间卷积层将原始音频波形编码为深层、高分辨率的表示,替代传统的基于STFT的特征提取。
- 采用双向长短期记忆(LSTM)网络,以建模回声和混合信号中的长程时间依赖关系。
- 引入局部注意力机制,将远端信号与近端混合信号对齐,以补偿可变时延和混响的影响。
- 实施多任务学习框架,其中独立的分类头用于预测双Talk状态(如仅近端、仅远端、双Talk)。
- 在掩码网络中应用ReSigmoid激活函数,相比标准Sigmoid函数,可提升回声抑制效果。
- 使用一维转置卷积进行波形重建,实现从掩码表示端到端可微分的音频合成。
实验结果
研究问题
- RQ1在非线性失真和背景噪声条件下,端到端深度学习模型是否能优于经典自适应滤波器在AEC中的表现?
- RQ2将双Talk检测作为辅助任务集成后,是否能提升双Talk时段的回声消除性能?
- RQ3在存在可变时延和混响的情况下,局部注意力机制在远端信号与混合信号之间对齐的改善程度如何?
- RQ4直接在原始波形上进行训练是否能获得比依赖谱特征的方法更好的回声抑制效果和语音质量?
- RQ5当在与训练条件不同的真实脉冲响应(RIR)上测试时,所提方法的鲁棒性如何?
主要发现
- 在合成非线性回声环境中,EchoFilter实现了59.32 dB的回声回声损耗增强(ERLE),显著优于基线方法(AES+RES:10.13 dB,Multitask:46.12 dB)。
- 在双Talk场景中,所提方法的PESQ得分为1.30,而多任务基线为0.70,AES+RES为0.21,表明其在语音质量保持方面表现更优。
- 在Aachen数据库中实测的RIR上,EchoFilter在0 dB信号-回声比(SER)下实现了70.93 dB的ERLE,优于CAD-AEC(56.51 dB)和AES+RES(12.16 dB)。
- 当在合成RIR上训练并在真实世界的“走廊”RIR上测试时,EchoFilter在线性模型中保持68.71 dB的ERLE,在非线性模型中为66.39 dB,优于CAD-AEC在所有SER水平下的表现。
- 与CAD-AEC相比,PESQ增益随SER升高而增加,在7 dB SER下非线性模型中达到0.52,表明在恶劣条件下具备更强的鲁棒性。
- 消融研究验证表明,ReSigmoid激活函数相比标准Sigmoid函数能带来更好的回声抑制效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。