[论文解读] NeuralEcho: A Self-Attentive Recurrent Neural Network For Unified Acoustic Echo Suppression And Speech Enhancement
NeuralEcho 提出了一种自注意力循环神经网络,通过利用跨通道的二阶统计量和多头注意力机制来建模回声、噪声和目标语音动态,统一了声学回声消除与语音增强。该方法在语音质量、识别准确率和模型效率方面均达到最先进水平,相比 F-T-LSTM 模型实现了 9.1% 的相对 WER 降低和 13.7% 的 SI-SDR 提升,且模型参数更小。
Acoustic echo cancellation (AEC) plays an important role in the full-duplex speech communication as well as the front-end speech enhancement for recognition in the conditions when the loudspeaker plays back. In this paper, we present an all-deep-learning framework that implicitly estimates the second order statistics of echo/noise and target speech, and jointly solves echo and noise suppression through an attention based recurrent neural network. The proposed model outperforms the state-of-the-art joint echo cancellation and speech enhancement method F-T-LSTM in terms of objective speech quality metrics, speech recognition accuracy and model complexity. We show that this model can work with speaker embedding for better target speech enhancement and furthermore develop a branch for automatic gain control (AGC) task to form an all-in-one front-end speech enhancement system.
研究动机与目标
- 解决传统自适应滤波和混合 AEC 系统在处理非线性回声、回声路径变化和非平稳噪声方面的局限性。
- 将声学回声消除(AEC)与语音增强统一到一个深度学习框架中,以提升鲁棒性并实现端到端优化。
- 通过在同一个模型中联合学习自动增益控制(AGC)和目标说话人增强,提升语音识别准确率。
- 利用麦克风、AEC 输出和回声估计通道之间的二阶统计量,增强回声/噪声抑制和目标语音保留效果。
- 集成说话人嵌入和 AGC 作为条件输入,以提升目标说话人分离效果和实时通信中的输出音量一致性。
提出的方法
- 提出一种两阶段端到端模型:首先估计回声和 AEC 输出,然后利用估计的回声/噪声与目标语音的二阶统计量(协方差矩阵)预测语音增强滤波器。
- 采用在时间维度上具有多头注意力机制的自注意力 RNN,动态强调回声估计、AEC 输出和麦克风输入通道中的相关特征。
- 使用特征自适应线性调制(FiLM)对网络进行条件化处理,通过说话人嵌入向量实现对目标语音与干扰信号的更好分离。
- 提出一种 AGC 分支的联合训练方案,可同时预测预 AGC 和后 AGC 输出,确保增强信号具有高可懂度和低失真。
- 将输入信号转换至频域,并应用可学习滤波器以建模时频域动态特性,同时通过注意力机制增强时间依赖性。
- 采用监督损失在干净目标语音上进行端到端训练,联合优化 AEC、增强和 AGC 目标。
实验结果
研究问题
- RQ1统一的深度学习框架是否能比现有混合或两阶段方法更有效地联合抑制声学回声和背景噪声?
- RQ2在多个信号通道间建模二阶统计量在多大程度上能提升回声和噪声抑制性能?
- RQ3在嘈杂且存在回声的环境中,引入说话人嵌入在多大程度上能增强目标语音分离效果?
- RQ4与后处理 AGC 相比,将 AGC 与主增强网络联合训练是否能带来更好的语音识别性能?
- RQ5自注意力 RNN 架构是否能在捕捉回声和噪声复杂时间动态方面优于标准 RNN 或 LSTM?
主要发现
- 尽管模型参数更小,NeuralEcho 在 SI-SDR 上相比最先进模型 F-T-LSTM 提升 13.7% 相对值,PESQ 提升 3.5%,WER 降低 9.1%。
- 具备说话人感知能力的 NeuralEcho 版本实现 SI-SDR 11.98 dB、PESQ 2.99 和 WER 14.06%,表明目标语音分离能力得到提升。
- 集成 AGC 分支的 NeuralEcho 模型在后 AGC 输出上实现最优 WER 13.63%,相比 F-T-LSTM 的 16.8% 相对降低。
- 与后处理 AGC(WER 14.75%)或在 AGC 处理数据上训练(WER 16.53%)相比,将 AGC 分支与 NeuralEcho 联合训练显著降低 WER 至 13.63%,证明了端到端优化的优势。
- 统一模型的预 AGC 输出在 PESQ 和 WER 上表现最佳,表明 AGC 集成在不损害核心增强质量的前提下提升了识别性能。
- 联合训练 AGC 和说话人嵌入的模型实现最佳整体性能,验证了统一前端处理在实时通信系统中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。