Skip to main content
QUICK REVIEW

[论文解读] An Investigation of End-to-End Multichannel Speech Recognition for Reverberant and Mismatch Conditions

Aswin Shanmugam Subramanian, Xiaofei Wang|arXiv (Cornell University)|Apr 19, 2019
Speech and Audio Processing参考文献 34被引用 17
一句话总结

该论文提出了一种端到端多通道自动语音识别(ASR)系统,通过仅使用ASR目标损失联合优化神经混响消除(WPE)、波束成形(MVDR)和声学建模,无需并行的干净-混响语音数据或迭代推理。该系统在REVERB数据集上达到最先进性能,并在不匹配的DIRHA数据集上取得显著提升,通过所有组件的联合、可微训练,展现出在真实世界混响和噪声环境下的鲁棒性。

ABSTRACT

Sequence-to-sequence (S2S) modeling is becoming a popular paradigm for automatic speech recognition (ASR) because of its ability to jointly optimize all the conventional ASR components in an end-to-end (E2E) fashion. This report investigates the ability of E2E ASR from standard close-talk to far-field applications by encompassing entire multichannel speech enhancement and ASR components within the S2S model. There have been previous studies on jointly optimizing neural beamforming alongside E2E ASR for denoising. It is clear from both recent challenge outcomes and successful products that far-field systems would be incomplete without solving both denoising and dereverberation simultaneously. This report uses a recently developed architecture for far-field ASR by composing neural extensions of dereverberation and beamforming modules with the S2S ASR module as a single differentiable neural network and also clearly defining the role of each subnetwork. The original implementation of this architecture was successfully applied to the noisy speech recognition task (CHiME-4), while we applied this implementation to noisy reverberant tasks (DIRHA and REVERB). Our investigation shows that the method achieves better performance than conventional pipeline methods on the DIRHA English dataset and comparable performance on the REVERB dataset. It also has additional advantages of being neither iterative nor requiring parallel noisy and clean speech data.

研究动机与目标

  • 研究将多通道语音增强(混响消除与波束成形)直接集成到端到端ASR中的可行性,以适用于远场应用场景。
  • 评估仅通过ASR目标损失联合优化混响消除、波束成形与ASR是否能提升在混响和不匹配条件下的鲁棒性。
  • 消除对并行干净-混响语音数据及迭代处理在端到端多通道ASR中的依赖。
  • 评估在真实世界远场数据(如DIRHA、REVERB真实集)上的泛化性能,其中训练数据条件与测试条件不同。

提出的方法

  • 该模型将基于神经网络的WPE混响消除与MVDR波束成形作为可微子网络,集成到序列到序列ASR框架中。
  • 混响消除子网络使用时间-频率掩码,通过深度神经网络(DNN)估计目标信号的幅度谱,替代传统的迭代WPE过程。
  • 波束形成子网络使用从估计的功率谱密度矩阵计算出的可微MVDR滤波器,可选地引入语音活动检测(SAD)类型掩码。
  • 所有组件通过仅使用ASR目标损失进行端到端联合训练,无需并行干净数据或显式的信号级监督。
  • 训练过程中,模型随机跳过混响消除或波束形成分支,以提升鲁棒性与泛化能力。
  • 该系统支持任意数量的输入通道,并能从中间子网络输出生成增强后的频谱图。

实验结果

研究问题

  • RQ1在混响和噪声环境中,集成神经混响消除与波束成形的端到端多通道ASR系统是否能优于传统的流水线方法?
  • RQ2仅通过ASR目标损失联合优化混响消除与波束成形,是否能在不匹配的真实世界测试集上实现鲁棒性能?
  • RQ3在具有挑战性的远场条件下,使用不同掩码类型(时频掩码与SAD掩码)对性能有何影响?
  • RQ4该系统是否能在不依赖并行干净-混响训练数据的情况下泛化到真实远场数据?

主要发现

  • 在不匹配的DIRHA测试集上,采用SAD掩码的联合端到端模型相比最佳流水线方法,相对WER降低了5.2%。
  • 在REVERB仿真数据集上,使用时频掩码的联合端到端模型表现最佳,优于所有流水线方法和独立的端到端基线模型。
  • 在REVERB挑战赛官方测试集上,该模型性能与最先进系统相当或更优,尤其在真实远场条件下表现突出。
  • 该系统能很好地泛化到未见过的通道配置,且无需迭代处理或并行干净数据。
  • 对频谱图的可视化分析表明,增强后的输出表现出更少的能量扩散与更清晰的背景,证实了有效的混响消除与降噪效果。
  • 该方法成功实现了仅通过ASR目标损失对所有组件进行联合优化,表明信号级目标并非实现有效增强的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。