[论文解读] Robust coherence-based spectral enhancement for distant speech recognition
本文提出了一种基于相干性的维纳后置滤波器,通过估计最小方差无畸变响应(MVDR)波束成形器输出端直达声与混响声功率的比值,将该比值用作时频域自适应的信噪比近似,从而在噪声环境中提升远距离语音识别性能。该方法在真实CHiME-3数据的开发集和测试集上分别将词错误率(WER)降低了2.73和5.2个百分点,计算复杂度低,且无需方向到达(DoA)信息。
In this contribution to the 3rd CHiME Speech Separation and Recognition Challenge (CHiME-3) we extend the acoustic front-end of the CHiME-3 baseline speech recognition system by a coherence-based Wiener filter which is applied to the output signal of the baseline beamformer. To compute the time- and frequency-dependent postfilter gains the ratio between direct and diffuse signal components at the output of the baseline beamformer is estimated and used as approximation of the short-time signal-to-noise ratio. The proposed spectral enhancement technique is evaluated with respect to word error rates of the CHiME-3 challenge baseline speech recognition system using real speech recorded in public environments. Results confirm the effectiveness of the coherence-based postfilter when integrated into the front-end signal enhancement.
研究动机与目标
- 在混响和背景噪声导致识别准确率下降的真实噪声环境中,提升自动语音识别(ASR)性能。
- 解决基线MVDR波束成形器在抑制混响噪声方面存在的局限性,特别是在远距离说话场景下的表现。
- 开发一种计算效率高的、不依赖方向到达(DoA)信息的前端增强技术,以补充现有波束成形方法。
- 将该后置滤波器集成到CHiME-3基线ASR系统中,评估其在真实和模拟数据上的鲁棒性。
- 证明相干性与混响声功率比(CDR)估计在实际、真实场景中进行谱增强的有效性。
提出的方法
- 将基于相干性的维纳后置滤波器应用于基线MVDR波束成形器的输出,以抑制混响噪声和混响。
- 利用自功率谱和互功率谱估计波束成形器输出端直达声与混响声功率的比值,作为时频域自适应的信噪比近似。
- 利用估计的CDR比值在短时傅里叶变换(STFT)域计算后置滤波增益,实现谱增强。
- 将后置滤波器实现为低复杂度、不依赖DoA的滤波器,无需额外的空间校准。
- 将增强后的信号集成到CHiME-3基线ASR流程中,使用HMM-GMM和HMM-DNN声学模型进行评估。
- 利用波束成形器输出的扩散度度量 $ D_{\text{BF}}(l,f) $ 来估计CDR,该度量用于指导后置滤波增益的计算。
实验结果
研究问题
- RQ1基于相干性的后置滤波器是否能在真实世界噪声条件下提升远距离语音识别的词错误率(WER)?
- RQ2所提出的后置滤波器在真实和模拟CHiME-3数据上的性能表现如何?
- RQ3不依赖DoA的CDR估计是否足以在实际场景中提供足够的鲁棒性和准确性以实现谱增强?
- RQ4该后置滤波器与HMM-GMM和HMM-DNN声学模型结合时是否均有效?
- RQ5该后置滤波器的低复杂度设计是否支持在资源受限系统中实现实时部署?
主要发现
- 所提出的基于相干性的后置滤波器在真实CHiME-3数据的开发集上将词错误率(WER)降低了2.73个百分点,在测试集上降低了5.2个百分点。
- 该改进在HMM-GMM和HMM-DNN ASR系统中均表现一致,其中HMM-DNN系统在真实开发数据上表现优于HMM-GMM。
- 在模拟数据上,后置滤波器导致WER升高,可能由于后置滤波器参数设置不佳或信号特性不匹配。
- 在模拟评估数据上,HMM-GMM系统优于HMM-DNN系统,表明当前工作中DNN架构可能存在未优化的局限性。
- 后置滤波器在真实数据上显著优于仅使用基线MVDR波束成形器的表现,证实了其在提升语音识别鲁棒性方面的有效性。
- 该方法实现了低计算复杂度和DoA独立性,使其适用于实际远距离语音应用场景中的实时部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。