Skip to main content
QUICK REVIEW

[论文解读] Recurrent Neural Network Transducer for Audio-Visual Speech Recognition

Takaki Makino, Hank Liao|arXiv (Cornell University)|Nov 8, 2019
Speech and Audio Processing参考文献 30被引用 15
一句话总结

该论文提出了一种基于RNN-T的视听语音识别系统,利用从YouTube获取的31,000小时视听数据集,实现了最先进性能。通过同步音频与视觉特征,并采用RNN-T进行联合建模,该系统在LRS3-TED基准测试中将词错误率降低至4.5%,并在噪声或语音重叠条件下表现出显著鲁棒性。

ABSTRACT

This work presents a large-scale audio-visual speech recognition system based on a recurrent neural network transducer (RNN-T) architecture. To support the development of such a system, we built a large audio-visual (A/V) dataset of segmented utterances extracted from YouTube public videos, leading to 31k hours of audio-visual training content. The performance of an audio-only, visual-only, and audio-visual system are compared on two large-vocabulary test sets: a set of utterance segments from public YouTube videos called YTDEV18 and the publicly available LRS3-TED set. To highlight the contribution of the visual modality, we also evaluated the performance of our system on the YTDEV18 set artificially corrupted with background noise and overlapping speech. To the best of our knowledge, our system significantly improves the state-of-the-art on the LRS3-TED set.

研究动机与目标

  • 开发一种可扩展的端到端视听语音识别系统,以提升在复杂声学环境下的鲁棒性。
  • 解决单模态ASR系统在噪声或语音重叠场景下的局限性。
  • 探索通过统一的RNN-T架构结合音频与视觉模态的优势,同时实现特征同步。
  • 利用人脸追踪与字幕对齐技术,从公开的YouTube视频中全自动构建大规模、全自动化视听训练数据集。
  • 证明视觉模态在音频质量下降时能显著提升识别性能,尤其在音频受损条件下。

提出的方法

  • 通过用户上传的字幕与人脸追踪技术,自动从YouTube中挖掘出150,000小时的纯音频数据,并提取出31,000小时的视听语音样本。
  • 应用人脸关键点平滑处理,并通过固定短时傅里叶变换窗口,将音频帧率对齐至视频帧率,实现音频与视觉特征的同步。
  • 采用受VGG启发的CNN从唇部区域图像剪辑中提取视觉嵌入,使用梅尔滤波器组系数提取音频特征。
  • 采用RNN-T架构,包含独立的编码器与解码器网络:编码器处理音频与视觉输入,解码器生成字符级输出。
  • 通过序列到序列损失联合训练编码器、解码器与联合网络,实现隐式语言建模与单调对齐。
  • 支持端到端训练与字符级输出,无需基于音素的转录,从而实现开放词汇识别。

实验结果

研究问题

  • RQ1基于RNN-T的视听ASR系统是否能在LRS3-TED等大规模词汇量基准上实现最先进性能?
  • RQ2在背景噪声或语音重叠条件下,视觉模态在多大程度上提升了识别鲁棒性?
  • RQ3与较小规模、人工筛选的数据集相比,大规模自动构建的视听数据集在多大程度上提升了系统性能?
  • RQ4在不同视频质量条件下(如人脸大小、姿态、分辨率),纯视觉ASR的性能如何变化?
  • RQ5在真实世界条件下,RNN-T架构是否优于CTC或注意力机制模型用于视听语音识别?

主要发现

  • 该视听RNN-T系统在LRS3-TED基准测试中实现了4.5%的词错误率(WER),为该论文发表时的最先进结果。
  • 纯视觉系统在LRS3-TED上的WER为33.6%,显著优于先前的纯视觉模型(如CTC-V2P的55.1%),并在高质量演播室录制数据上表现出强劲性能。
  • 在人工添加噪声条件下,视听系统保持4.5%的WER,相比纯音频系统(4.8%)有明显提升,表现出在劣化条件下的强鲁棒性。
  • 在更具挑战性的YTDev18数据集上,纯视觉系统的WER为48.5%,在低质量视频片段上进一步上升至57.0%,凸显其对图像质量与现实世界变化的敏感性。
  • 在LRS3-TED数据集上,该系统优于TM-seq2seq模型(7.2% WER),证明了使用更大规模数据集与RNN-T架构的优势。
  • 在仅使用音频进行训练与推理时,系统实现4.8%的WER;在使用音频与视觉联合输入时,WER降至4.5%,表明即使在大规模纯音频数据下,视觉输入仍能提供稳定且可观测的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。