[论文解读] Noise Robust IOA/CAS Speech Separation and Recognition System For The Third 'CHIME' Challenge
本论文针对第三届CHiME挑战赛提出了一套抗噪语音分离与识别系统,前端采用语音失真加权多通道维纳滤波器(SDW-MWF)进行增强,后端结合深度神经网络(DNN、CNN、LSTM)与词网重打分技术实现自动语音识别(ASR)。该系统在真实测试数据上实现了60.9%的相对词错误率(WER)降低,WER降至13.2%,显著优于最佳GMM基线系统(33.23%)。
This paper presents the contribution to the third 'CHiME' speech separation and recognition challenge including both front-end signal processing and back-end speech recognition. In the front-end, Multi-channel Wiener filter (MWF) is designed to achieve background noise reduction. Different from traditional MWF, optimized parameter for the tradeoff between noise reduction and target signal distortion is built according to the desired noise reduction level. In the back-end, several techniques are taken advantage to improve the noisy Automatic Speech Recognition (ASR) performance including Deep Neural Network (DNN), Convolutional Neural Network (CNN) and Long short-term memory (LSTM) using medium vocabulary, Lattice rescoring with a big vocabulary language model finite state transducer, and ROVER scheme. Experimental results show the proposed system combining front-end and back-end is effective to improve the ASR performance.
研究动机与目标
- 提升在餐厅、公交车、街道等真实噪声环境下自动语音识别(ASR)的性能。
- 通过优化的前端处理,解决多通道语音增强中噪声抑制与语音失真之间的权衡问题。
- 通过深度学习模型(DNN、CNN、LSTM)与大规模词汇语言模型的词网重打分技术,提升后端ASR的鲁棒性。
- 在真实噪声条件下,实现第三届CHiME语音分离与识别挑战赛的最先进性能。
提出的方法
- 采用语音失真加权多通道维纳滤波器(SDW-MWF)估计目标语音信号,通过可调参数μ优化噪声抑制与语音失真之间的权衡。
- 基于优化准则推导SDW-MWF滤波器:最小化语音失真期望值与加权噪声功率之和,公式为 min E{|w^H y - X1|^2 + μ|w^H n|^2}。
- 在训练和测试数据上均应用SDW-MWF,以减少训练与测试条件之间的不匹配,通过随机SNR扰动(-6dB至+6dB)进行数据增强。
- 采用DNN、CNN和LSTM声学模型实现端到端声学建模,DNN与CNN在性能上显著优于GMM基线。
- 利用大规模词汇有限状态转移器语言模型实现词网重打分,以优化假设输出。
- 通过ROVER(识别输出投票纠错)方案融合多个系统输出,提升最终识别准确率。
实验结果
研究问题
- RQ1在多通道语音增强中,如何优化噪声抑制与语音失真之间的权衡以实现鲁棒的ASR?
- RQ2与传统的GMM-HMM系统相比,深度神经网络(DNN、CNN、LSTM)在噪声与混响环境下的ASR性能提升程度如何?
- RQ3使用大规模词汇语言模型的词网重打分能否进一步降低噪声语音识别中的词错误率?
- RQ4通过ROVER融合多个基于神经网络的系统,如何提升真实世界测试集上的整体ASR性能?
主要发现
- SDW-MWF前端将真实测试数据上的WER从MVDR基线的37.36%降低至23.19%(GMM模型下),证明了其在有效抑制噪声的同时控制失真的显著效果。
- 采用DNN结合sMBR训练与随机SNR数据增强后,真实测试数据上的WER降至18.4%,表明深度学习在噪声环境下的有效性。
- 基于CNN的声学模型进一步将WER降低至17.87%,LSTM则达到18.96%的WER,表明循环与卷积网络在建模时序与谱特征方面更具优势。
- 词网重打分将WER从18.4%(DNN+sMBR)降低至15.3%,从17.87%(CNN+sMBR)降低至16.37%,证明其在优化ASR输出方面的有效性。
- 最终系统通过ROVER融合DNN、CNN与LSTM系统,并结合词网重打分,在真实测试数据上实现13.2%的WER,相比最佳GMM基线(33.23%)实现了60.9%的相对降低。
- 最佳单系统(DNN+sMBR结合词网重打分)在公交车场景下实现17.74% WER,咖啡馆场景下为11.75%,行人区域为13.34%,街角场景为9.96%,表明其在各类环境下的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。