[论文解读] Deep model with built-in cross-attention alignment for acoustic echo cancellation
本文提出 Align-CRUSE,一种用于声学回声消除(AEC)的实时深度学习模型,通过在网络架构中直接集成基于交叉注意力的对齐机制,消除了对外部延迟估计的依赖。该模型在 AEC Challenge 数据集上达到最先进性能,在硬延迟情况下 ERLE 提升高达 7 dB,AECMOS 提升 0.24,同时保持低延迟与计算成本,适用于 Microsoft Teams 中的实时部署。
With recent research advances, deep learning models have become an attractive choice for acoustic echo cancellation (AEC) in real-time teleconferencing applications. Since acoustic echo is one of the major sources of poor audio quality, a wide variety of deep models have been proposed. However, an important but often omitted requirement for good echo cancellation quality is the synchronization of the microphone and far end signals. Typically implemented using classical algorithms based on cross-correlation, the alignment module is a separate functional block with known design limitations. In our work we propose a deep learning architecture with built-in self-attention based alignment, which is able to handle unaligned inputs, improving echo cancellation performance while simplifying the communication pipeline. Moreover, we show that our approach achieves significant improvements for difficult delay estimation cases on real recordings from AEC Challenge data set.
研究动机与目标
- 为解决实时 AEC 系统中麦克风信号与远端信号之间存在信号偏移这一关键挑战,该偏移会降低回声消除性能。
- 消除对传统外部对齐模块(如互相关)的依赖,这些模块在动态环境中易出错且计算成本高。
- 开发一种低复杂度、实时的深度学习架构,通过在特征空间中端到端实现软对齐,天然处理可变且长时延的回声路径。
- 在长延迟、非线性回声路径和双 talk 等挑战性场景下提升 AEC 性能,同时保持低推理延迟。
- 实现在 Microsoft Teams 等大规模生产系统中的实际部署,其中鲁棒性与低延迟对数百万用户至关重要。
提出的方法
- 该模型采用类似 CRUSE 的 U-Net 架构,其瓶颈层引入循环块,但进一步通过内置交叉注意力模块增强对齐能力。
- 交叉注意力机制在麦克风信号与远端信号的时间-频率特征之间计算软对齐,学习跨多个时延的延迟分布。
- 与依赖信号域互相关的方法不同,对齐在深层特征空间中完成,使模型能够处理非线性和时变的回声路径。
- 注意力模块以麦克风特征作为查询,对远端特征进行注意力聚合,生成动态对齐的上下文表示。
- 模型采用端到端训练,损失函数针对回声抑制进行优化,以 AECMOS 和 ERLE 作为关键指标。
- 通过 20ms 汉宁窗与 10ms 帧移,模型保持 20ms 的算法延迟,实现在 CPU 上的实时推理。
实验结果
研究问题
- RQ1深度学习模型是否能在不依赖外部信号对齐模块的情况下实现鲁棒的回声消除?
- RQ2在特征空间中采用端到端交叉注意力对齐,与经典互相关方法相比,在回声抑制性能和对延迟估计误差的鲁棒性方面表现如何?
- RQ3内置对齐机制在长延迟或可变延迟等挑战性场景下,能将性能提升到何种程度?
- RQ4集成对齐机制的模型是否能保持低推理延迟与计算复杂度,适合大规模系统中的实时部署?
- RQ5与最先进 AEC 解决方案相比,该模型在双 talk 场景下的表现如何?
主要发现
- 与实时对齐的 CRUSE 基线相比,Align-CRUSE 在包含困难延迟估计情况的 FEST-HD 子集上,ERLE 提升 7.22 dB,AECMOS 提升 0.24。
- 在合成长延迟数据集(LD-M 和 LD-H)上,该模型相比全局对齐的 CRUSE‡‡ 基线,AECMOS 最高提升 0.6,ERLE 最高提升 7 dB。
- 与基础 CRUSE 模型相比,该模型仅增加 0.01M 个参数,推理时间几乎不变(≈2.5 ms/帧),确保低延迟实时运行。
- 在双 talk 和 FEST MOS 评估中,Align-CRUSE 显著优于 CRUSE‡ 基线,且与 AEC Challenge 冠军模型相比表现具有竞争力,同时速度提升 5–7 倍。
- 该模型已成功部署于 Microsoft Teams,显著提升数百万名用户每日通话的音频质量,证明了其在真实场景中的可扩展性与鲁棒性。
- 注意力图可视化结果表明,模型能够学习有意义的延迟分布,并在复杂、噪声大或信号严重偏移的条件下仍能有效对齐信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。