Skip to main content
QUICK REVIEW

[论文解读] Audio-visual Recognition of Overlapped speech for the LRS2 dataset

Jianwei Yu, Shi-Xiong Zhang|arXiv (Cornell University)|Jan 6, 2020
Speech and Audio Processing参考文献 34被引用 10
一句话总结

该论文提出了一种新颖的音频-视觉语音识别(AVSR)系统,用于重叠语音场景,采用混合LF-MMI时延神经网络(TDNN)架构并结合门控融合机制,在LRS2数据集上实现了最先进性能。与仅使用音频的基线模型相比,该方法将词错误率(WER)降低了高达29.98个百分点,并达到了更复杂流水线系统的表现水平。

ABSTRACT

Automatic recognition of overlapped speech remains a highly challenging task to date. Motivated by the bimodal nature of human speech perception, this paper investigates the use of audio-visual technologies for overlapped speech recognition. Three issues associated with the construction of audio-visual speech recognition (AVSR) systems are addressed. First, the basic architecture designs i.e. end-to-end and hybrid of AVSR systems are investigated. Second, purposefully designed modality fusion gates are used to robustly integrate the audio and visual features. Third, in contrast to a traditional pipelined architecture containing explicit speech separation and recognition components, a streamlined and integrated AVSR system optimized consistently using the lattice-free MMI (LF-MMI) discriminative criterion is also proposed. The proposed LF-MMI time-delay neural network (TDNN) system establishes the state-of-the-art for the LRS2 dataset. Experiments on overlapped speech simulated from the LRS2 dataset suggest the proposed AVSR system outperformed the audio only baseline LF-MMI DNN system by up to 29.98\% absolute in word error rate (WER) reduction, and produced recognition performance comparable to a more complex pipelined system. Consistent performance improvements of 4.89\% absolute in WER reduction over the baseline AVSR system using feature fusion are also obtained.

研究动机与目标

  • 为解决在重叠语音场景中,由于声学干扰导致性能严重下降的自动语音识别挑战。
  • 探究在重叠语音中,音频-视觉融合是否能通过利用视觉线索减轻声学退化,从而提升识别鲁棒性。
  • 开发一种集成的AVSR系统,通过lattice-free MMI(LF-MMI)准则联合优化语音增强与识别,避免流水线架构的局限性。
  • 比较混合与端到端AVSR架构,识别在重叠语音识别中更优的设计方案。
  • 提出并评估新型门控融合机制,实现在不同可靠性条件下动态调整音频-视觉信息融合。

提出的方法

  • 采用混合LF-MMI TDNN架构进行AVSR,基于清晰语音和重叠语音数据端到端训练,以优化判别性语音识别性能。
  • 引入两种门控融合机制:基于视觉模态驱动的(V ⊗ A)和基于音视频模态驱动的(AV ⊗ A),根据模态可靠性动态加权音频与视觉特征。
  • 使用门控融合层,学习类似注意力的权重,以抑制不可靠的视觉输入,提升在视觉质量下降时的鲁棒性。
  • 应用lattice-free MMI(LF-MMI)准则进行序列级判别性训练,实现无需显式语音分离组件的集成AVSR系统联合优化。
  • 在不同信噪比(SNR)水平(-5dB至10dB)下,使用清晰语音与双人重叠语音的混合数据进行训练,模拟真实噪声环境。
  • 将所提出的集成系统与包含独立语音分离与识别模块的流水线架构进行对比,使用清晰数据与增强(分离后)数据进行多条件训练。

实验结果

研究问题

  • RQ1在LRS2数据集上,混合AVSR系统是否优于端到端AVSR系统在重叠语音识别中的表现?
  • RQ2与传统特征拼接融合相比,门控融合机制是否能提升AVSR性能,尤其是在视觉输入不可靠时?
  • RQ3通过LF-MMI训练的集成AVSR系统是否能达到使用显式语音分离和多条件训练的复杂流水线系统的性能水平?
  • RQ4在低SNR条件下,引入视觉模态对重叠语音中的WER降低有何影响?
  • RQ5与分别优化分离与识别组件相比,通过LF-MMI实现的联合优化在多大程度上提升了识别鲁棒性?

主要发现

  • 所提出的LF-MMI TDNN混合AVSR系统在LRS2数据集上实现了最先进性能,优于以往的端到端AVSR系统。
  • 门控融合机制(AV ⊗ A)相比基于特征拼接的融合,将WER降低了4.89个百分点(相对降低32%),表明其在模态退化情况下具有更强鲁棒性。
  • 与仅使用音频的LF-MMI DNN基线相比,集成AVSR系统将WER降低了高达29.98个百分点,显著优于仅使用音频的系统。
  • 表现最佳的集成系统在所有SNR水平下的平均WER为10.80%,与采用多条件训练的更复杂流水线系统性能相当。
  • 使用音频帧级对齐进行训练的仅视觉系统表现有所提升,表明音频监督可增强唇读模型性能。
  • 混合AVSR系统在LRS2数据集上优于端到端AVSR系统,表明混合架构在复杂重叠语音识别任务中更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。