Skip to main content
QUICK REVIEW

[论文解读] Residual acoustic echo suppression based on efficient multi-task convolutional neural network

Xinquan Zhou, Yanhong Leng|arXiv (Cornell University)|Sep 29, 2020
Speech and Audio Processing参考文献 21被引用 6
一句话总结

本文提出了一种基于高效多任务卷积神经网络(CNN)的实时残余回声抑制(RAES)方法,联合预测相位敏感掩码并检测双 talk 状态。通过引入一种新型抑制损失函数以平衡回声抑制与近端信号保留,该方法在标准 CPU 上实现了仅 0.05 的实时因子,回声抑制增益超过 40 dB,PESQ/STOI 评分优异,适用于个人设备的部署。

ABSTRACT

Acoustic echo degrades the user experience in voice communication systems thus needs to be suppressed completely. We propose a real-time residual acoustic echo suppression (RAES) method using an efficient convolutional neural network. The double talk detector is used as an auxiliary task to improve the performance of RAES in the context of multi-task learning. The training criterion is based on a novel loss function, which we call as the suppression loss, to balance the suppression of residual echo and the distortion of near-end signals. The experimental results show that the proposed method can efficiently suppress the residual echo under different circumstances.

研究动机与目标

  • 为解决语音通信系统中残余回声退化的问题,特别是传统 AEC 在处理后仍存在非线性回声分量的情况。
  • 降低双 talk 期间近端语音的失真,这是传统非线性处理器在 AEC 系统中面临的主要局限。
  • 开发一种计算效率高的深度学习模型,可部署于资源受限的个人设备(如智能手机和笔记本电脑)。
  • 通过在多任务学习框架中将双 talk 检测作为辅助任务,提升掩码预测的准确性。
  • 通过一种新型抑制损失函数,平衡回声抑制与语音质量保留。

提出的方法

  • 该方法采用受 MobileNetV2 启发的 CNN 架构,结合深度可分离卷积以降低计算成本,同时保持性能。
  • 输入特征由远端信号和自适应滤波器输出误差信号的对数谱图组成,将 20 帧的特征拼接以提供时序上下文。
  • 网络采用多任务学习设置:主干分支预测相位敏感掩码(PSM)用于回声抑制,辅助分支通过条件注意力机制估计双 talk 状态。
  • 引入一种新型抑制损失函数,以平衡回声抑制与近端信号失真,其中抑制比 α 可调节。
  • 使用相位敏感掩码作为目标,以保留语音的相位信息,提升主观质量。
  • 模型使用 Adam 优化器进行训练,学习率为 0.003,批量大小为 1024,输入特征经归一化处理,并使用平方根汉宁窗进行加窗。

实验结果

研究问题

  • RQ1多任务深度学习框架是否能在最小化近端语音失真的同时,提升残余回声抑制性能?
  • RQ2将双 talk 检测作为辅助任务集成,是否能提升在复杂声学条件下相位敏感掩码预测的准确性?
  • RQ3轻量级 CNN 架构是否能在不牺牲回声抑制或语音质量的前提下,实现在标准个人设备上的实时性能?
  • RQ4所提出的抑制损失函数在不同信噪比(SER)下,是否能有效平衡回声抑制与近端信号保留?
  • RQ5相位敏感掩码在主观质量与可懂度方面,相较于传统基于幅度的掩码方法,优势有多大?

主要发现

  • 在单远端说话人场景下,所提出的 RAES 方法实现超过 40 dB 的 ERLE,显著优于 AEC3(29.976 dB)和基于 DNN 的方法(31.492 dB),尤其在回声中同时存在语音与音乐时表现更优。
  • 在双 talk 条件下,当 α=0.5 时,RAES 模型的 PESQ 得分为 2.816(仅语音)和 2.864(语音+音乐),优于 AEC3(1.610 和 1.734)和 DNN(2.666 和 2.729)。
  • 在 0 dB SER 条件下,RAES(α=0.5)的 STOI 得分为 0.875(仅语音)和 0.872(语音+音乐),显著高于 AEC3(0.623 和 0.641)和 DNN(0.856 和 0.848)。
  • 该模型在 2.5 GHz x86_64 CPU 上实现了仅 0.05 的实时因子,远优于 DNN 模型的 0.89,表明其在个人设备上具有极高的实时部署潜力。
  • 双 talk 检测器在训练集上达到 93.0% 的 F1 分数,在验证集上达到 90.3%,表明检测可靠,可有效支持双 talk 期间的准确掩码预测。
  • 抑制比 α 允许灵活权衡:α=0.5 提供更强的回声抑制,但失真略高;而 α=1.0 提供更优的语音质量,但抑制效果略有下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。