[论文解读] Noise-Robust ASR for the third 'CHiME' Challenge Exploiting Time-Frequency Masking based Multi-Channel Speech Enhancement and Recurrent Neural Network
本论文针对第三届CHiME挑战赛提出了一套抗噪自动语音识别(ASR)系统,结合基于多通道幅度平方相干性(MSC)和相位差测量(PDM)的时频掩蔽语音增强技术,以及基于循环神经网络(RNN)的声学模型与判别式训练方法。该系统在真实世界测试数据上相较最佳基线实现了57%的相对词错误率(WER)降低,通过解码轨迹组合与RNN重打分,最终WER达到14.28%。
In this paper, the Lingban entry to the third 'CHiME' speech separation and recognition challenge is presented. A time-frequency masking based speech enhancement front-end is proposed to suppress the environmental noise utilizing multi-channel coherence and spatial cues. The state-of-the-art speech recognition techniques, namely recurrent neural network based acoustic and language modeling, state space minimum Bayes risk based discriminative acoustic modeling, and i-vector based acoustic condition modeling, are carefully integrated into the speech recognition back-end. To further improve the system performance by fully exploiting the advantages of different technologies, the final recognition results are obtained by lattice combination and rescoring. Evaluations carried out on the official dataset prove the effectiveness of the proposed systems. Comparing with the best baseline result, the proposed system obtains consistent improvements with over 57% relative word error rate reduction on the real-data test set.
研究动机与目标
- 开发一种基于移动设备多通道音频的鲁棒ASR系统,以应对真实世界中的噪声环境。
- 通过融合先进语音增强与深度学习技术,提升在噪声与混响条件下语音识别的性能。
- 通过自适应自校准方法解决移动设备中麦克风响应不匹配的问题。
- 通过轨迹组合与重打分技术,提升识别准确率。
提出的方法
- 时频掩蔽前端利用多通道幅度平方相干性(MSC)抑制扩散噪声,利用相位差测量(PDM)抑制定向干扰源。
- 系统采用自适应麦克风阵列自校准方法,以校正麦克风响应不匹配问题。
- 采用状态空间最小贝叶斯风险(sMBR)判别式训练方法,训练循环神经网络(RNN)声学模型,包括LSTMP与最大池化网络(maxout networks)。
- 特征包括经fMLLR变换的MFCC以及在线i-vectors,用于建模说话人、信道与噪声条件。
- 语言模型采用4-gram模型并结合Kneser-Ney平滑,第二轮重打分使用联合RNN-最大熵(RNNME)模型。
- 最终识别结果通过多个系统输出的轨迹组合获得,以提升鲁棒性与准确性。
实验结果
研究问题
- RQ1基于MSC与PDM的时频掩蔽在真实世界多通道录音中抑制噪声的效果如何?
- RQ2基于sMBR训练的RNN声学模型在噪声与远场ASR中能否显著降低WER?
- RQ3i-vectors与fMLLR特征的结合在多大程度上提升了对说话人与信道变化的鲁棒性?
- RQ4轨迹组合与RNNME模型的多轮重打分能否在个体系统性能基础上进一步降低WER?
主要发现
- 所提出的语音增强前端在增强数据上相较基线实现了12.81%的绝对WER降低。
- 性能最佳的系统结合LSTMP+sMBR声学建模、RNNME重打分与轨迹组合,在真实测试集上达到最终WER 14.28%。
- 该系统在真实世界数据上相较最佳基线实现超过57%的相对WER降低,模拟数据上为42%。
- 在所有配置中,fMLLR特征与i-vectors的结合始终优于Fbank特征。
- sMBR判别式训练在所有声学模型中均带来一致的WER改善,其中LSTMP+sMBR优于基于maxout的模型。
- 将性能最佳的两个系统(LSTMP+sMBR与Maxout+dp+sMBR)进行轨迹组合并结合RNNME重打分,取得了最佳整体性能,证实了集成方法的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。