[论文解读] Multi-Scale Attention Neural Network for Acoustic Echo Cancellation
本论文提出了一种用于声学回波消除(AEC)的端到端多尺度注意力神经网络,采用具有空洞卷积的1D时间卷积网络(TCN),从远端和近端信号中提取多尺度频谱图特征。注意力机制动态加权不同感受野尺度的特征,增强了对非线性失真、背景噪声和双talk的鲁棒性。该方法在具有挑战性的现实条件下实现了最先进的ERLE性能(高达58.53 dB)和PESQ性能(高达1.76的增益)。
Acoustic Echo Cancellation (AEC) plays a key role in speech interaction by suppressing the echo received at microphone introduced by acoustic reverberations from loudspeakers. Since the performance of linear adaptive filter (AF) would degrade severely due to nonlinear distortions, background noises, and microphone clipping in real scenarios, deep learning has been employed for AEC for its good nonlinear modelling ability. In this paper, we constructed an end-to-end multi-scale attention neural network for AEC. Temporal convolution is first used to transform waveform into spectrogram. The spectrograms of the far-end reference and the near-end mixture are concatenated, and fed to a temporal convolution network (TCN) with stacked dilated convolution layers. Attention mechanism is performed among these representations from different layers to adaptively extract relevant features by referring to the previous hidden state in the encoder long short-term memory (LSTM) unit. The representations are weighted averaged and fed to the encoder LSTM for the near-end speech estimation. Experiments show the superiority of our method in terms of the echo return loss enhancement (ERLE) for single-talk periods and the perceptual evaluation of speech quality (PESQ) score for double-talk periods in background noise and nonlinear distortion scenarios.
研究动机与目标
- 为解决线性自适应滤波器在真实AEC应用中处理非线性失真、背景噪声和麦克风削波方面的局限性。
- 改善在传统方法失效的双talk和非线性声学环境下的回波抑制性能。
- 开发一种端到端的深度学习框架,以捕捉多尺度的时间和频谱特征,实现鲁棒的回波消除。
- 通过在具有不同感受野的空洞卷积层之间集成注意力机制,增强特征表示。
- 验证模型在合成和真实世界混响冲击响应(RIR)上的泛化能力,包括来自不同声学环境的实测RIR。
提出的方法
- 应用1D时间卷积将原始波形转换为高分辨率频谱图,其方式类似于STFT但使用可学习滤波器。
- 将远端参考信号和近端混合信号的频谱图拼接后输入TCN,通过堆叠的空洞卷积捕捉多尺度时间特征。
- 在不同空洞卷积层的特征表示上应用注意力机制,利用编码器LSTM的前一隐藏状态来引导特征加权。
- 将加权的特征表示求和后输入编码器LSTM,以估计近端语音信号。
- 解码器使用转置1D卷积从掩码特征中重建增强的波形。
- 整个网络通过优化回波抑制和语音质量的损失函数进行端到端训练。
实验结果
研究问题
- RQ1多尺度注意力机制是否能在存在非线性失真和背景噪声的情况下提升AEC性能?
- RQ2在感受野逐渐增大的空洞卷积层之间应用注意力机制,如何增强回波消除的特征表示?
- RQ3所提出的端到端框架是否在双talk和非线性场景下优于传统自适应滤波器和先前的深度学习方法?
- RQ4当在合成RIR上训练并在真实测量的RIR上测试时,模型的泛化能力如何?
- RQ5混响时间与信噪比(SNR)水平的变化对模型鲁棒性和性能有何影响?
主要发现
- 在非线性场景下,该方法实现了58.53 dB的ERLE和3.5 dB的SER,显著优于AES+RES(16.76 dB)和Multitask(61.79 dB)基线。
- 在存在背景噪声的双talk条件下,模型实现了1.76的ΔPESQ增益,优于AES+RES(0.93)和Multitask(1.04)。
- 在10 dB SNR的噪声条件下,模型实现了52.99 dB的ERLE和1.53的ΔPESQ,优于Multitask(46.12 dB ERLE,0.70 ΔPESQ)。
- 在Aachen数据库中实测的‘走廊’测试环境中,模型实现了55.74 dB的ERLE和1.46的ΔPESQ,优于AES+RES(12.16 dB ERLE,0.57 ΔPESQ)。
- 当在合成RIR上训练并在真实‘走廊’RIR上测试时,模型实现了1.18–1.27的ΔPESQ增益,优于CAD-AEC在线性和非线性模型中的表现。
- 该模型展现出更优的非线性建模能力,在非线性RIR中实现了38.63 dB的ERLE,优于CAD-AEC的19.08 dB,尽管在线性RIR中的ERLE略低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。