Skip to main content
QUICK REVIEW

[论文解读] End-to-end Audio-visual Speech Recognition with Conformers

Pingchuan Ma, Stavros Petridis|arXiv (Cornell University)|Feb 12, 2021
Speech and Audio Processing参考文献 36被引用 4
一句话总结

该论文提出了一种端到端的音视频语音识别模型,采用 Conformer 模型从原始波形和像素中联合提取音频和视觉特征,结合混合 CTC/注意力解码器与基于 Transformer 的语言模型。该模型在 LRS2 和 LRS3 数据集上实现了最先进性能,在 LRS3 v0.0 上的词错误率(WER)降低至 1.2%(音视频联合),在 LRS3 v0.4 上为 2.3%,尽管训练数据量显著减少,仍优于先前方法。

ABSTRACT

In this work, we present a hybrid CTC/Attention model based on a ResNet-18 and Convolution-augmented transformer (Conformer), that can be trained in an end-to-end manner. In particular, the audio and visual encoders learn to extract features directly from raw pixels and audio waveforms, respectively, which are then fed to conformers and then fusion takes place via a Multi-Layer Perceptron (MLP). The model learns to recognise characters using a combination of CTC and an attention mechanism. We show that end-to-end training, instead of using pre-computed visual features which is common in the literature, the use of a conformer, instead of a recurrent network, and the use of a transformer-based language model, significantly improve the performance of our model. We present results on the largest publicly available datasets for sentence-level speech recognition, Lip Reading Sentences 2 (LRS2) and Lip Reading Sentences 3 (LRS3), respectively. The results show that our proposed models raise the state-of-the-art performance by a large margin in audio-only, visual-only, and audio-visual experiments.

研究动机与目标

  • 开发一种端到端的音视频语音识别模型,可直接处理原始音频和视频输入,无需预计算的特征。
  • 通过用 Conformer 替代循环神经网络并采用基于 Transformer 的语言模型来提升性能。
  • 证明在原始输入上进行联合端到端训练可获得优于使用预提取特征的模型的性能。
  • 在大规模、真实场景的 LRS2 和 LRS3 数据集上评估模型,涵盖清晰和嘈杂环境。
  • 展示音视频融合在高噪声环境中显著提升模型鲁棒性。

提出的方法

  • 模型使用修改后的带有 3D 卷积的 ResNet-18 处理由像素提取的视觉输入,以及使用 1D 卷积处理由波形提取的音频输入,以从原始数据中提取特征。
  • 视觉和音频特征由 Conformer 编码器处理,该编码器结合卷积与自注意力机制,实现时序建模。
  • 两种模态的特征通过多层感知机(MLP)进行融合,之后输入到混合 CTC/注意力解码器。
  • 模型通过 CTC 损失和注意力损失进行端到端训练,并使用基于 Transformer 的语言模型以提升解码性能。
  • 使用原始音频波形而非对数梅尔滤波器组特征,以增强在嘈杂环境下的鲁棒性。
  • 该架构在 LRS2 和 LRS3 上进行评估,并对数据量、输入模态和训练策略进行消融研究。
Fig. 1 : End-to-end audio-visual speech recognition architecture. The inputs are pixels and raw audio waveforms.
Fig. 1 : End-to-end audio-visual speech recognition architecture. The inputs are pixels and raw audio waveforms.

实验结果

研究问题

  • RQ1与使用预计算特征的模型相比,基于原始音频和视觉输入的端到端训练是否能提升音视频语音识别性能?
  • RQ2用 Conformer 替代循环神经网络是否能在音视频语音识别中带来显著的性能提升?
  • RQ3与基于 RNN 的模型相比,使用基于 Transformer 的语言模型如何影响识别准确率?
  • RQ4一个在较小数据集上训练的模型是否能超越在更大数据集上训练的模型,尤其是在嘈杂或具有挑战性的条件下?
  • RQ5音视频融合如何增强在高噪声环境下的鲁棒性?

主要发现

  • 所提出的模型在 LRS3 v0.0 上实现了 1.2% 的词错误率(WER)(音视频联合识别),创下新的最先进水平。
  • 在 LRS3 v0.4 上,模型在音视频联合识别中实现了 2.3% 的 WER,相比先前方法高出 2.2 个百分点。
  • 仅使用视觉的模型在 LRS3 v0.4 上实现了 43.3% 的 WER,尽管训练数据更少,但仍优于以往方法。
  • 仅使用音频的模型在 LRS3 v0.0 上实现了 1.3% 的 WER,提升至 v0.4 时为 2.3%,证明了原始音频训练的鲁棒性。
  • 该模型仅使用 438 小时的 LRS3 数据,便超越了使用 31,000 小时数据(YT)训练的方法,显示出卓越的数据效率。
  • 音视频融合显著提升了性能,尤其是在高噪声环境中,证实了两种模态的互补性。
Fig. 2 : Word Error Rate (WER) as a function of the noise level. A: End-to-End audio model. V: End-to-End visual model, AV: End-to-End audio-visual model. log-Mel filter-bank: A conformer model trained with log-Mel filter-bank features.
Fig. 2 : Word Error Rate (WER) as a function of the noise level. A: End-to-End audio model. V: End-to-End visual model, AV: End-to-End audio-visual model. log-Mel filter-bank: A conformer model trained with log-Mel filter-bank features.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。