[论文解读] Improving noise robust automatic speech recognition with single-channel time-domain enhancement network
本文提出Denoising-TasNet,一种基于Conv-TasNet的单通道时域语音增强网络,旨在提升噪声鲁棒性自动语音识别(ASR)性能。即使不微调ASR后端,在真实CHiME-4测试数据上,该方法仍实现了超过30%的相对词错误率(WER)降低,证明时域去噪可显著提升ASR性能,超越频域方法。
With the advent of deep learning, research on noise-robust automatic speech recognition (ASR) has progressed rapidly. However, ASR performance in noisy conditions of single-channel systems remains unsatisfactory. Indeed, most single-channel speech enhancement (SE) methods (denoising) have brought only limited performance gains over state-of-the-art ASR back-end trained on multi-condition training data. Recently, there has been much research on neural network-based SE methods working in the time-domain showing levels of performance never attained before. However, it has not been established whether the high enhancement performance achieved by such time-domain approaches could be translated into ASR. In this paper, we show that a single-channel time-domain denoising approach can significantly improve ASR performance, providing more than 30 % relative word error reduction over a strong ASR back-end on the real evaluation data of the single-channel track of the CHiME-4 dataset. These positive results demonstrate that single-channel noise reduction can still improve ASR performance, which should open the door to more research in that direction.
研究动机与目标
- 探究最先进的时域语音增强是否能提升噪声鲁棒性ASR性能。
- 在端到端ASR系统中,比较时域去噪网络与传统频域方法的性能。
- 评估数据增强对单通道语音增强与ASR性能的影响。
- 评估增强系统在不同数据集和噪声条件下的泛化能力。
提出的方法
- 将Conv-TasNet架构适配用于单通道噪声抑制,通过从含噪波形中重建干净语音进行训练。
- 提出两种变体:一种仅预测增强后的语音,另一种同时预测语音与噪声,用于多任务训练。
- 采用多任务损失函数,结合语音与噪声重建损失,以正则化训练并提升泛化能力。
- 使用基于预测波形与目标波形之间均方误差的时域损失函数。
- 在包含10万个含噪语音样本的大规模增强数据集上训练增强网络,以提升鲁棒性。
- 将训练好的增强前端与预训练的ASR后端(无需微调)集成,以评估真实含噪数据上的ASR性能。
实验结果
研究问题
- RQ1时域语音增强网络是否能在真实世界含噪录音中显著提升ASR性能?
- RQ2当ASR后端未微调时,时域去噪带来的性能增益是否能有效传递至ASR?
- RQ3数据增强如何影响单通道增强系统的泛化能力与ASR性能?
- RQ4所提出的增强方法是否能泛化至CHiME-4数据集以外的不同噪声条件与ASR后端?
主要发现
- 即使不微调ASR后端,Denoising-TasNet在真实CHiME-4测试数据上仍实现了超过30%的相对词错误率(WER)降低。
- 尽管频域基线方法(如FD-BLSTM和FD-Conv-FDL)的SDR更高,但Denoising-TasNet在SDR和ASR性能上均优于它们。
- 将训练样本从3.5万增至10万后,Denoising-TasNet与FD-BLSTM的ASR性能均显著提升,后者在Enh-AM设置下于真实CHiME-4数据上达到10.40%的WER。
- 该增强系统在Aurora-4数据集上也表现出良好泛化能力,将噪声测试集的WER从8.5%降低至6.3%,且在干净测试集上性能下降极小。
- 采用语音与噪声分开输出的多任务训练方式,提升了泛化能力,并带来了优于单输出训练的ASR性能。
- 结果表明,单通道时域去噪仍是提升噪声鲁棒性ASR的可行且高效的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。