Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling

Tsu-Jui Fu, Linjie Li|arXiv (Cornell University)|Sep 4, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

本文对端到端视频-语言转换器中的掩码视觉建模(MVM)进行了全面的实证研究,提出VIOLETv2——一种通过空间聚焦图像特征(SIF)增强的MVM目标,是最有效的MVM方法。该方法在13个视频-语言基准上实现了最先进性能,视频问答准确率提升+5.4%,文本到视频检索召回率提升+6.6%,视频字幕CIDEr得分提升+11.4,表明基于SIF的MVM在端到端训练原始视频输入时,能显著提升下游任务性能。

ABSTRACT

Masked visual modeling (MVM) has been recently proven effective for visual pre-training. While similar reconstructive objectives on video inputs (e.g., masked frame modeling) have been explored in video-language (VidL) pre-training, previous studies fail to find a truly effective MVM strategy that can largely benefit the downstream performance. In this work, we systematically examine the potential of MVM in the context of VidL learning. Specifically, we base our study on a fully end-to-end VIdeO-LanguagE Transformer (VIOLET), where the supervision from MVM training can be backpropagated to the video pixel space. In total, eight different reconstructive targets of MVM are explored, from low-level pixel values and oriented gradients to high-level depth maps, optical flow, discrete visual tokens, and latent visual features. We conduct comprehensive experiments and provide insights into the factors leading to effective MVM training, resulting in an enhanced model VIOLETv2. Empirically, we show VIOLETv2 pre-trained with MVM objective achieves notable improvements on 13 VidL benchmarks, ranging from video question answering, video captioning, to text-to-video retrieval.

研究动机与目标

  • 研究各种掩码视觉建模(MVM)目标在端到端视频-语言预训练中的有效性。
  • 识别从低级特征到高级表征的各类MVM目标中,哪一类最能有效提升下游视频-语言理解性能。
  • 分析掩码策略、掩码比例以及MVM目标组合对模型性能的影响。
  • 开发并验证一种增强的端到端视频-语言模型VIOLETv2,采用最有效的MVM方案。
  • 揭示MVM目标的有效性在视频-文本与图像-文本预训练之间存在显著差异。

提出的方法

  • 本研究基于VIOLET模型,该模型为完全端到端的视频-语言Transformer,可处理原始视频帧,并实现从MVM监督到像素级特征的反向传播。
  • 评估了八种不同的MVM目标:RGB像素值、方向梯度直方图(HOG)、深度图、光流、离散视觉标记(VQ)、空间聚焦图像特征(SIF)、时间感知视频特征(TVF)以及来自CLIP的多模态特征(MMF)。
  • 在预训练过程中,随机掩码空间和时间维度上的图像块,模型被训练以重建被掩码的视觉目标。
  • 模型与视频-文本匹配(VTM)和掩码语言建模(MLM)联合预训练,形成多任务学习目标。
  • 将表现最佳的MVM目标(SIF)集成到VIOLETv2中,并在13个下游VidL基准上进行微调。
  • 对掩码比例、策略以及多目标MVM组合进行了大量消融实验,以优化训练过程。

实验结果

研究问题

  • RQ1在端到端视频-语言预训练中,哪种掩码视觉建模(MVM)目标能带来最显著的性能提升?
  • RQ2MVM目标在视频-文本与图像-文本预训练场景中的有效性有何差异?
  • RQ3在视频-语言模型中,有效的MVM训练应采用何种最优掩码策略与比例?
  • RQ4多种MVM目标的组合如何影响下游性能?
  • RQ5在原始视频输入上进行端到端MVM训练,是否能超越在提取特征上预训练的模型?

主要发现

  • 空间聚焦图像特征(SIF)是视频-语言预训练中最有效的MVM目标,显著优于RGB像素、HOG、深度图和光流等其他目标。
  • 基于SIF的MVM带来的性能增益具有特定于视频-文本预训练的特性;当应用于图像-文本对时,SIF会导致下游性能大幅下降,表明其有效性具有模态特异性。
  • VIOLETv2在SIF-MVM预训练下,相较于在相同500万视频-文本语料上预训练的模型,视频问答准确率平均提升+5.4%,文本到视频检索召回率提升+6.6%,视频字幕CIDEr得分提升+11.4。
  • 即使在更少数据上预训练,VIOLETv2仍优于原始VIOLET模型,表明所提出的MVM策略具有高效性和可扩展性。
  • MVM的最优掩码比例被发现为时空块的30–50%左右,比例过高会导致监督过强,从而降低性能。
  • 将SIF与其他MVM目标(如VQ或HOG)结合仅带来微小增益,表明SIF本身已足够实现优异性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。