Skip to main content
QUICK REVIEW

[论文解读] Dual-path Self-Attention RNN for Real-Time Speech Enhancement

Ashutosh Pandey, DeLiang Wang|arXiv (Cornell University)|Oct 23, 2020
Speech and Audio Processing参考文献 22被引用 13
一句话总结

本文提出双路自注意力RNN(DP-SARNN),一种时域语音增强模型,通过用自注意力RNN(SARNN)替换双路RNN(DP-RNN)中的RNN,以提升长序列建模能力。通过采用四倍大的帧移和因果注意力机制,DP-SARNN 实现了每32 ms数据块7.9 ms的实时处理,优于先前方法在离线和实时设置下的表现。

ABSTRACT

We propose a dual-path self-attention recurrent neural network (DP-SARNN) for time-domain speech enhancement. We improve dual-path RNN (DP-RNN) by augmenting inter-chunk and intra-chunk RNN with a recently proposed efficient attention mechanism. The combination of inter-chunk and intra-chunk attention improves the attention mechanism for long sequences of speech frames. DP-SARNN outperforms a baseline DP-RNN by using a frame shift four times larger than in DP-RNN, which leads to a substantially reduced computation time per utterance. As a result, we develop a real-time DP-SARNN by using long short-term memory (LSTM) RNN and causal attention in inter-chunk SARNN. DP-SARNN significantly outperforms existing approaches to speech enhancement, and on average takes 7.9 ms CPU time to process a signal chunk of 32 ms.

研究动机与目标

  • 解决在嘈杂环境中对低延迟、实时语音增强的需求。
  • 通过将注意力机制整合到双路RNN中,提升时域语音增强中的长序列建模能力。
  • 在保持或提升增强质量的同时,降低计算成本和处理延迟。
  • 开发一种具备因果性、支持实时推理的模型,其性能优于现有时域方法。
  • 通过未来对所提架构的探索,实现跨语料库的泛化能力。

提出的方法

  • 将最近提出的自注意力RNN(SARNN)引入双路RNN(DP-RNN),以增强块间和块内建模能力。
  • 使用SARNN模块,通过可学习的查询、键和值向量,将RNN与参数高效的注意力机制相结合。
  • 应用残差连接和层归一化以稳定训练并改善梯度流动。
  • 在块间SARNN中实现因果注意力,以确保支持实时推理。
  • 采用四倍于基线DP-RNN的帧移(8 ms vs. 2 ms),以降低处理负载和延迟。
  • 使用相位约束的幅度(PCM)损失和混合精度训练,以实现更快收敛。

实验结果

研究问题

  • RQ1自注意力机制是否能提升双路RNN在时域语音增强中的长序列建模能力?
  • RQ2在DP-RNN中用SARNN替换RNN是否能在保持或提升性能的同时降低计算成本?
  • RQ3基于因果SARNN的架构能否实现低延迟的实时处理?
  • RQ4所提出的DP-SARNN在STOI和PESQ得分上与最先进时域模型相比表现如何?
  • RQ5增大帧移对实时语音增强中模型性能和延迟有何影响?

主要发现

  • DP-SARNN 每32 ms信号块的平均CPU处理时间为7.9 ms,适用于实时应用。
  • 尽管模型复杂度更高,DP-SARNN 在处理速度上仍优于DCN(11.0 ms)和DP-RNN(17.4 ms)。
  • 平均而言,DP-SALSTM 在STOI上比DCN提升1.7%,在PESQ上提升0.15分,且在-5 dB SNR时增益最大。
  • 非因果的DP-SABLSTM变体在所有模型中表现最佳,其STOI和PESQ得分超过DP-BLSTM及其他基线模型。
  • DP-SALSTM 在降低延迟的同时保持了优异性能,证明了结合注意力机制的大帧移设计可有效保持语音质量。
  • 该模型在多种噪声类型和SNR水平下表现稳健,且在使用babble和cafeteria噪声的测试集上展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。