[论文解读] ADL-MVDR: All deep learning MVDR beamformer for target speech separation
该论文提出ADL-MVDR,一种全深度学习的MVDR波束成形器,通过使用两个循环神经网络(RNN)替代矩阵求逆和特征值分解,实现稳定且端到端的训练。该方法在显著降低残留噪声的同时保持极低的非线性失真,相较于纯神经网络系统将自动语音识别(ASR)准确率提升了42%,并在所有客观指标上优于传统MVDR波束成形器。
Speech separation algorithms are often used to separate the target speech from other interfering sources. However, purely neural network based speech separation systems often cause nonlinear distortion that is harmful for automatic speech recognition (ASR) systems. The conventional mask-based minimum variance distortionless response (MVDR) beamformer can be used to minimize the distortion, but comes with high level of residual noise. Furthermore, the matrix operations (e.g., matrix inversion) involved in the conventional MVDR solution are sometimes numerically unstable when jointly trained with neural networks. In this paper, we propose a novel all deep learning MVDR framework, where the matrix inversion and eigenvalue decomposition are replaced by two recurrent neural networks (RNNs), to resolve both issues at the same time. The proposed method can greatly reduce the residual noise while keeping the target speech undistorted by leveraging on the RNN-predicted frame-wise beamforming weights. The system is evaluated on a Mandarin audio-visual corpus and compared against several state-of-the-art (SOTA) speech separation systems. Experimental results demonstrate the superiority of the proposed method across several objective metrics and ASR accuracy.
研究动机与目标
- 为解决纯神经网络语音分离系统中的非线性失真问题,该失真会损害自动语音识别(ASR)性能。
- 降低传统MVDR波束成形器中的残留噪声,尽管其具有无失真波束成形特性,但残留噪声仍限制语音质量。
- 在与深度神经网络联合训练时,稳定MVDR中矩阵求逆和特征值分解的数值计算。
- 开发一种端到端可训练的框架,利用帧级波束成形权重实现更优的语音分离。
- 探索使用RNN学习MVDR解法的可行性,以替代传统的数学运算。
提出的方法
- ADL-MVDR框架用两个RNN替代传统MVDR中的矩阵求逆和主成分分析(PCA),递归估计噪声协方差矩阵的逆矩阵以及导向矢量的PCA。
- 采用复数比值滤波(cRF)方法以提升协方差矩阵估计和联合训练的稳定性,替代传统的时间-频率掩码。
- 前端滤波估计器为Conv-TasNet的变体,用于预测语音和噪声的帧级协方差矩阵。
- RNN与前端网络端到端联合训练,实现自适应的帧级波束成形权重估计。
- MVDR波束成形权重计算公式为 $ \mathbf{h}(f) = \frac{\mathbf{\Phi}_{\text{NN}}^{-1}(f)\boldsymbol{v}(f)}{\mathbf{v}^{\mathrm{H}}(f)\mathbf{\Phi}_{\text{NN}}^{-1}(f)\mathbf{v}(f)} $,其中协方差矩阵的逆由RNN预测。
- 系统采用联合损失函数进行训练,同时优化语音分离和波束成形性能。
实验结果
研究问题
- RQ1RNN能否在端到端训练过程中有效替代MVDR波束成形器中的矩阵求逆和PCA运算,同时保持数值稳定性?
- RQ2将传统MVDR替换为基于深度学习的解决方案,是否能在不引入非线性失真的前提下减少残留噪声?
- RQ3在客观指标和ASR准确率方面,所提出的ADL-MVDR框架相较于最先进的神经网络基和混合MVDR系统表现如何?
- RQ4使用复数比值滤波(cRF)是否能进一步稳定训练过程,并提升MVDR协方差矩阵估计的性能?
- RQ5通过RNN实现的帧级波束成形权重估计,是否比使用语音样本级或分段级权重在降低残留噪声方面更有效?
主要发现
- ADL-MVDR系统在词错误率(WER)上实现42%的相对提升,从22.07%(使用cRF的神经网络)降低至12.73%。
- 与次佳基线(使用cRF的MVDR)相比,PESQ得分提升0.32分,达到3.42,同时达到14.80 dB的Si-SNR,优于所有基线模型。
- 在极端条件下(说话人夹角为0–15°),PESQ得分提升62%(从1.88提升至3.04),表明对近距离说话干扰具有强鲁棒性。
- ADL-MVDR系统显著降低残留噪声,达到15.45 dB的SDR,优于使用cRF的MVDR(14.04 dB)和使用cRF的神经网络(13.01 dB)。
- 基于cRF的ADL-MVDR系统在所有指标上均优于基于cRM的系统,Si-SNR提升0.27 dB,WER改善0.42%。
- 所提方法在保持目标语音无失真的同时最小化噪声,如最低WER和所有客观指标最高分所证实。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。