Skip to main content
QUICK REVIEW

[论文解读] Multi-channel Multi-frame ADL-MVDR for Target Speech Separation

Zhuohuang Zhang, Yong Xu|arXiv (Cornell University)|Dec 24, 2020
Speech and Audio Processing参考文献 78被引用 5
一句话总结

该论文提出了一种多通道多帧全深度学习MVDR(MCMF ADL-MVDR)框架,通过基于RNN的滤波联合优化神经掩码估计与时变波束成形权值,显著降低了非线性失真和残留噪声。该方法在语音质量、可懂度和自动语音识别(ASR)准确率方面达到最先进性能,优于同等推理成本下的纯神经网络及传统神经掩码基MVDR系统。

ABSTRACT

Many purely neural network based speech separation approaches have been proposed to improve objective assessment scores, but they often introduce nonlinear distortions that are harmful to modern automatic speech recognition (ASR) systems. Minimum variance distortionless response (MVDR) filters are often adopted to remove nonlinear distortions, however, conventional neural mask-based MVDR systems still result in relatively high levels of residual noise. Moreover, the matrix inverse involved in the MVDR solution is sometimes numerically unstable during joint training with neural networks. In this study, we propose a multi-channel multi-frame (MCMF) all deep learning (ADL)-MVDR approach for target speech separation, which extends our preliminary multi-channel ADL-MVDR approach. The proposed MCMF ADL-MVDR system addresses linear and nonlinear distortions. Spatio-temporal cross correlations are also fully utilized in the proposed approach. The proposed systems are evaluated using a Mandarin audio-visual corpus and are compared with several state-of-the-art approaches. Experimental results demonstrate the superiority of our proposed systems under different scenarios and across several objective evaluation metrics, including ASR performance.

研究动机与目标

  • 解决纯神经网络语音分离系统中因非线性失真和残留噪声导致的ASR性能下降问题。
  • 克服传统神经掩码基MVDR系统在与深度网络联合训练时的数值不稳定性问题。
  • 利用多通道和多帧之间的时空互相关性,提升语音分离性能。
  • 开发一种端到端可训练、支持在线处理的波束成形系统,具备低延迟和高效率。
  • 在语音质量、可懂度和自动语音识别准确率方面实现卓越性能。

提出的方法

  • 将深度神经网络(DNN)用于时频掩码估计,并结合基于学习的时变MVDR波束成形器,后者使用RNN预测的波束成形权值。
  • 采用多通道多帧(MCMF)方法,联合建模麦克风阵列与相邻帧之间的空间与时间相关性。
  • 使用基于RNN的网络(GRU-Net)预测动态波束成形权值,避免传统MVDR中的矩阵求逆和数值不稳定性。
  • 应用复数比滤波(cRF)联合建模相位与幅度分量,提升分离准确率。
  • 通过波束成形权值的递归更新实现在线、流式兼容的推理,区别于基于分块的MVDR方法。
  • 采用可微分损失函数端到端联合训练整个系统,同时优化语音质量和ASR性能。

实验结果

研究问题

  • RQ1神经掩码估计与自适应波束成形的联合学习框架是否能降低深度学习语音分离中的非线性失真?
  • RQ2引入多帧与多通道时空相关性是否能提升分离性能并减少残留噪声?
  • RQ3基于RNN的波束成形权值预测能否消除神经掩码基MVDR系统中的数值不稳定性问题?
  • RQ4所提出的ADL-MVDR系统是否在ASR准确率和语音质量上优于纯神经网络或传统神经掩码基MVDR系统?
  • RQ5在减小模型规模的同时,系统是否能维持高性能并支持实时流式推理?

主要发现

  • MC ADL-MVDR(紧凑型)模型在PESQ上相对提升15%,Si-SNR提升27%,WER降低18%,相较于使用cRF的MVDR系统,尽管模型规模更小。
  • 所提系统实现PESQ为3.37,WER为13.01%,优于使用cRF的MVDR基线(PESQ: 2.90,WER: 16.74%),且推理时间相近(27.0 ms vs. 31.3 ms)。
  • 单纯增大模型规模(如使用更大DNN或MVDR系统)仅带来微小增益,表明性能提升主要源于架构创新而非参数容量。
  • 基于RNN的波束成形器在联合训练中避免了数值不稳定性,而传统MVDR系统因需矩阵求逆而存在此问题。
  • 系统保持了低残留噪声和极小的非线性失真,体现在所有对比方法中客观指标最高、WER最低。
  • 该方法通过递归波束成形权值更新,实现了高效的在线处理,支持流式输入,而基于分块的MVDR系统不具备此能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。