Skip to main content
QUICK REVIEW

[论文解读] Robust end-to-end deep audiovisual speech recognition

Ramon Sanabria, Florian Metze|arXiv (Cornell University)|Nov 21, 2016
Speech and Audio Processing参考文献 11被引用 6
一句话总结

该论文提出了一种基于双向LSTM与连接时序分类(CTC)损失的端到端音视频语音识别系统,用于联合音频-视觉特征融合。该方法在IBM ViaVoice数据集上实现了最先进性能,将词错误率降低至11.7%,并表明CTC峰值位置与语音产生动态(尤其是共音现象)具有有意义的关联。

ABSTRACT

Speech is one of the most effective ways of communication among humans. Even though audio is the most common way of transmitting speech, very important information can be found in other modalities, such as vision. Vision is particularly useful when the acoustic signal is corrupted. Multi-modal speech recognition however has not yet found wide-spread use, mostly because the temporal alignment and fusion of the different information sources is challenging. This paper presents an end-to-end audiovisual speech recognizer (AVSR), based on recurrent neural networks (RNN) with a connectionist temporal classification (CTC) loss function. CTC creates sparse "peaky" output activations, and we analyze the differences in the alignments of output targets (phonemes or visemes) between audio-only, video-only, and audio-visual feature representations. We present the first such experiments on the large vocabulary IBM ViaVoice database, which outperform previously published approaches on phone accuracy in clean and noisy conditions.

研究动机与目标

  • 开发一种鲁棒的端到端音视频语音识别系统,无需依赖隐马尔可夫模型(HMMs)或人工对齐,有效融合音频与视觉模态。
  • 探究CTC在多模态背景下‘尖峰式’输出激活的可解释性,特别是峰值位置与语音产生时间的关系。
  • 评估在干净与噪声环境下,早期融合(特征级)与晚期融合(得分级)在音视频识别中的性能增益。
  • 分析音频与视频模态之间的时序错位,并评估CTC模型如何通过联合训练自动纠正该问题。
  • 确定多条件训练是否能提升对噪声的鲁棒性,以及视觉特征是否能在声学环境退化时增强识别准确率。

提出的方法

  • 采用双向长短期记忆(LSTM)网络作为核心架构,用于建模音频与视觉流中的序列依赖关系。
  • 使用连接时序分类(CTC)损失进行端到端训练,支持无对齐的序列到序列学习,并通过‘空’标记处理可变长度输入。
  • 通过在RNN输入前拼接音频(FBank + 语音基频)与视觉(SIFT、面部关键点)特征,实现早期融合,支持联合时间建模。
  • 通过在多条件数据(干净与噪声)上进行训练,实现数据增强,以提升对真实世界声学退化的鲁棒性。
  • 通过偏移音频、视频与音视频输出之间的对齐比较,补偿技术延迟(如编解码器延迟)。
  • 使用音素与视觉音素作为目标单元,采用标准映射将39个音素映射为12个视觉音素,并通过音素准确率与词错误率评估性能。

实验结果

研究问题

  • RQ1在大词汇量数据集上,基于端到端CTC的音视频融合与传统HMM/GMM系统相比,词错误率表现如何?
  • RQ2在音视频语音产生背景下,CTC模型的‘尖峰式’激活结构是否具有可解释性,特别是与共音现象的关系?
  • RQ3音频与视觉特征的早期融合是否优于晚期融合或单模态系统,从而带来更好的对齐与性能?
  • RQ4音频与视频流之间的时序延迟如何影响模型对齐?模型能否自动纠正此类问题?
  • RQ5多条件训练在多大程度上提升了音视频语音识别对噪声的鲁棒性?

主要发现

  • 所提出的音视频模型在IBM ViaVoice完整数据集上实现了11.7%的词错误率(WER),为该基准的最低已发表WER值。
  • 与先前使用交叉熵训练的DNN基线相比,该系统在音素准确率方面表现更优,使用FBank + 语音基频特征时达到83.0%的音素准确率。
  • 使用SIFT描述符的纯视频特征在结合面部关键点与速度特征后,达到65.7%的视觉音素准确率,优于单一组件。
  • 音视频融合的CTC输出峰值在音频单模态与视频单模态峰值之间具有时间对齐性,表明模型能纠正错位并提升鲁棒性。
  • 视频模态的峰值在时间上始终先于音频模态,支持语音产生中存在预期性共音现象的存在。
  • 在音频与视频流之间存在±330ms偏移时,WER与音素准确率无显著变化,表明CTC框架对时序错位具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。