[论文解读] Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Multi-Person Video
本文提出一种视频视觉变换器(ViT)前端,用于在视听语音识别中替代3D卷积神经网络,将视频片段处理为3D块并应用自注意力机制进行视觉特征提取。基于ViT的前端实现了最先进性能,在LRS3-TED数据集上相较卷积基线相对减少15%的词错误率(WER),微调后达到1.6%的WER。
Audio-visual automatic speech recognition (AV-ASR) extends speech recognition by introducing the video modality as an additional source of information. In this work, the information contained in the motion of the speaker's mouth is used to augment the audio features. The video modality is traditionally processed with a 3D convolutional neural network (e.g. 3D version of VGG). Recently, image transformer networks arXiv:2010.11929 demonstrated the ability to extract rich visual features for image classification tasks. Here, we propose to replace the 3D convolution with a video transformer to extract visual features. We train our baselines and the proposed model on a large scale corpus of YouTube videos. The performance of our approach is evaluated on a labeled subset of YouTube videos as well as on the LRS3-TED public corpus. Our best video-only model obtains 31.4% WER on YTDEV18 and 17.0% on LRS3-TED, a 10% and 15% relative improvements over our convolutional baseline. We achieve the state of the art performance of the audio-visual recognition on the LRS3-TED after fine-tuning our model (1.6% WER). In addition, in a series of experiments on multi-person AV-ASR, we obtained an average relative reduction of 2% over our convolutional video frontend.
研究动机与目标
- 探究视觉变换器(ViT)架构是否能在视听语音识别的视频前端中超越3D卷积神经网络。
- 评估基于ViT的视频编码在低资源和噪声环境下的有效性,特别是唇读和多人场景下的表现。
- 通过在大规模YouTube数据集上微调,实现在LRS3-TED基准上的最先进性能。
- 通过人工添加的背景人声噪声,比较ViT与卷积前端在音频质量下降条件下的鲁棒性。
- 分析在YouTube多样化视频预训练后,于高质量TED数据上微调时的领域偏移影响。
提出的方法
- 视频前端将输入视频处理为32×32×8大小的3D块,随后通过可学习的线性投影将每个块嵌入。
- 使用标准的Transformer编码器(含多头自注意力与前馈层)处理嵌入后的块,以提取全局时空依赖关系。
- 将视觉特征与240维的对数梅尔谱特征拼接,输入下游的视听编码器(Transformer或Conformer)进行序列到序列建模。
- 模型在大规模YouTube视频数据集上进行端到端预训练,使用RNN-T损失,随后在LRS3-TED数据集上进行微调。
- 为评估鲁棒性,将LRS3-TED测试集加入信噪比为20dB、10dB和0dB的背景人声噪声,以评估在音频质量下降时的性能。
- 在包含重叠语音的YouTube视频子集上评估多人视听语音识别,比较ViT与卷积前端的表现。
实验结果
研究问题
- RQ1基于视觉变换器的视频前端是否能在视听语音识别中实现与3D卷积神经网络相当或更优的性能?
- RQ2ViT前端是否在低资源设置下(如仅从视频输入进行唇读)表现更优?
- RQ3在音频质量下降的条件下(特别是加入背景人声噪声时),ViT前端表现如何?
- RQ4在高质量TED数据上微调是否能实现在LRS3-TED上的最先进性能?ViT前端是否比卷积基线泛化能力更强?
- RQ5ViT前端在存在重叠语音与视觉输入的多人场景下表现如何?
主要发现
- 在YTDEV18数据集上,基于ViT的视频前端实现31.4%的WER,相较3D卷积基线(40.5% WER)相对提升10%。
- 在LRS3-TED数据集上,ViT前端在仅视频设置下实现17.0% WER,相较卷积基线(28.2% WER)相对降低15%。
- 在YouTube与LRS3-TED数据50-50混合的微调后,ViT模型在LRS3-TED上达到1.6% WER,与此前最先进结果持平。
- 在噪声条件下(0dB背景人声噪声),ViT前端保持强性能,WER为2.9%,而纯音频模型为6.1%。
- 在多人视听语音识别场景中,ViT前端相较卷积基线平均降低2%相对WER。
- 在LRS3-TED上微调未能提升唇读性能,可能由于YouTube与TED数据集间音频质量存在领域偏移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。