Skip to main content
QUICK REVIEW

[论文解读] Guided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASR

Naoyuki Kanda, Christoph Boeddeker|arXiv (Cornell University)|May 29, 2019
Speech and Audio Processing参考文献 30被引用 12
一句话总结

该论文通过将引导源分离(GSS)与强大的自动语音识别(ASR)后端紧密集成,提出了一套面向CHiME-5家庭聚餐语料库的最先进ASR系统。联合系统在开发集上达到39.94%的词错误率(WER),在测试集上达到41.64%,为迄今发表的最佳结果,表明该任务的困难性源于固有的声学挑战,而非数据稀缺性。

ABSTRACT

In this paper, we present Hitachi and Paderborn University's joint effort for automatic speech recognition (ASR) in a dinner party scenario. The main challenges of ASR systems for dinner party recordings obtained by multiple microphone arrays are (1) heavy speech overlaps, (2) severe noise and reverberation, (3) very natural conversational content, and possibly (4) insufficient training data. As an example of a dinner party scenario, we have chosen the data presented during the CHiME-5 speech recognition challenge, where the baseline ASR had a 73.3% word error rate (WER), and even the best performing system at the CHiME-5 challenge had a 46.1% WER. We extensively investigated a combination of the guided source separation-based speech enhancement technique and an already proposed strong ASR backend and found that a tight combination of these techniques provided substantial accuracy improvements. Our final system achieved WERs of 39.94% and 41.64% for the development and evaluation data, respectively, both of which are the best published results for the dataset. We also investigated with additional training data on the official small data in the CHiME-5 corpus to assess the intrinsic difficulty of this ASR task.

研究动机与目标

  • 开发一种面向具有严重语音重叠、混响和噪声的复杂CHiME-5家庭聚餐场景的最先进ASR系统。
  • 探究CHiME-5中高词错误率(WER)是否源于数据稀缺性,还是源于固有的声学挑战。
  • 评估在该困难环境下,使用更大规模训练数据对声学模型(AM)和语言模型(LM)性能的影响。
  • 证明将先进语音增强技术(GSS)与强大ASR后端结合,在多说话人、噪声和混响环境中具有显著有效性。

提出的方法

  • 利用空间混合模型和时间标注的源活动信息,应用引导源分离(GSS)以估计目标信号和失真掩膜,用于波束成形。
  • 将加权预测误差(WPE)用于去混响处理,结合MVDR波束成形与盲分析归一化后处理滤波器,实现鲁棒的源信号提取。
  • 将GSS生成的增强语音输出集成到基于CNN-TDNN-RBiLSTM架构的强ASR后端中,并采用LF-sMBR训练方法。
  • 使用官方语言模型,并通过开发集调优插值权重以优化语言模型性能。
  • 通过训练基于LibriSpeech的声学模型(960小时)并结合AMI与LibriSpeech转录文本(最多1060万词)进行语言模型预训练,评估大规模训练数据的影响。
  • 通过使用官方CHiME-5训练数据(40小时)进行消融研究,并与更大规模数据结果对比,以隔离数据稀缺性的影响。
Figure 2: Overview of CNN-TDNN-RBiLSTM acoustic model
Figure 2: Overview of CNN-TDNN-RBiLSTM acoustic model

实验结果

研究问题

  • RQ1引导源分离与强大ASR后端的紧密集成是否能在CHiME-5家庭聚餐场景中显著降低词错误率?
  • RQ2CHiME-5中高词错误率主要源于训练数据不足,还是源于语音重叠、混响等固有的声学挑战?
  • RQ3在该困难环境下,使用非官方、更大规模语料库训练的声学模型和语言模型,其性能提升如何?
  • RQ4在存在严重环境退化(如噪声和混响)的情况下,大规模数据带来的性能增益是否会减弱?

主要发现

  • 联合系统在开发集上达到39.94%的词错误率(WER),在测试集上达到41.64%,均为CHiME-5数据集迄今发表的最佳结果。
  • 即使使用基于LibriSpeech的声学模型(960小时)进行训练,词错误率仍高达62.09%,表明仅增加数据量无法解决核心挑战。
  • 通过AMI与LibriSpeech语料(共1060万词)训练的最佳语言模型,仅将词错误率降低0.93%,表明大规模语言模型数据的收益有限。
  • CHiME-5任务的内在困难性主要源于声学条件,如严重的语音重叠、混响和噪声,而非数据稀缺性。
  • GSS与强大ASR后端的结合显著优于基线系统,证明了增强与识别模块端到端集成的价值。
  • 结果表明,当前ASR系统在真实世界多说话人、噪声环境中仍远未达到人类水平性能,凸显了在鲁棒语音识别领域仍需进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。