Skip to main content
QUICK REVIEW

[论文解读] SimVTP: Simple Video Text Pre-training with Masked Autoencoders

Yue Ma, Tianyu Yang|arXiv (Cornell University)|Dec 7, 2022
Multimodal Machine Learning Applications被引用 10
一句话总结

SimVTP 提出了一种简单而高效的视频-文本预训练框架,采用掩码自编码器技术,通过统一的 Transformer 编码器联合重建被掩码的视频片段和文本标记。该方法在极高掩码比例(视频 90%,文本 75%)下实现高性能,并具备数据高效性——仅使用 WebVid-2M 数据集的 10% 即在 MSRVTT 上达到 SOTA 水平(R@1 为 43.8%),同时通过对比学习和匹配损失进一步提升性能。

ABSTRACT

This paper presents SimVTP: a Simple Video-Text Pretraining framework via masked autoencoders. We randomly mask out the spatial-temporal tubes of input video and the word tokens of input text and then feed them into a unified autencoder to reconstruct the missing pixels and words. Our SimVTP has several properties: 1) Thanks to the unified autoencoder, SimVTP reconstructs the masked signal of one modality with the help from another modality, which implicitly learns the cross-modal alignment between video tubes and text tokens. 2) SimVTP not only benefits from a high video masking ratio (e.g. 90%) due to the temporal redundancy of video, but also needs a high text masking ratio (e.g. 75%), which is much higher than BERT (e.g. 15%), to achieve optimal performance. This is because the aid of video modality makes text reconstruction less challenging, which thus needs a higher mask ratio to make the pretext harder for useful feature learning. 3) Equipping SimVTP with video-text contrastive learning (VTC) and video-text matching (VTM), which are two commonly used cross-modal training strategies, could further improve the transferable performance significantly. 4) SimVTP is dataefficent, e.g., pre-training only on 10% data of WebVid-2M, SimVTP achieves surprisingly good results (43.8 R@1) on MSRVTT, which is far above recent state-of-the-art methods pre-trained on both CC3M and WebVid-2M. We transfer our pre-trained model to various downstream tasks and achieve superior performance. The codes and models will be released at https://github.com/mayuelala/SimVTP.

研究动机与目标

  • 开发一种简单且统一的视频-文本预训练框架,避免使用如目标检测器或区域学习器等复杂组件。
  • 探究在视频-文本学习中使用高掩码比例(视频最高达 90%,文本最高达 75%)的掩码自编码方法的有效性。
  • 评估掩码的视频-文本对是否可作为对比学习(VTC)和匹配学习(VTM)的有效数据增强手段。
  • 通过仅使用 WebVid-2M 数据集的 10% 实现 SOTA 性能,证明其数据高效性。
  • 探究编码器初始化方式对掩码自编码设置下多模态预训练性能的影响。

提出的方法

  • 统一的 Transformer 编码器同时处理视频片段和文本标记,实现对掩码输入的跨模态重建。
  • 采用类似 MAE 的策略对视频片段进行随机掩码,类似 BERT 的策略对文本标记进行掩码,分别设定 90% 和 75% 的掩码比例以获得最佳性能。
  • 通过模态间的交叉注意力机制重建缺失的视频像素和词标记,隐式学习片段与词之间的对齐关系。
  • 在掩码输入上集成视频-文本对比学习(VTC)和视频-文本匹配(VTM),进一步提升迁移性能。
  • 预训练阶段使用 VideoMAE 在 ImageNet-1K 或 Kinetics-400 上的权重进行编码器初始化,性能优于 BERT 或监督微调的 ImageNet-21K 权重。
  • 训练在掩码的视频-文本对上进行,VTC 仅应用于可见标记(占总数的 10%),从而降低 GPU 显存占用与计算开销。

实验结果

研究问题

  • RQ1统一的掩码自编码框架能否联合重建被掩码的视频片段和文本标记,以学习有效的跨模态表征?
  • RQ2尽管难度极高,使用极高的掩码比例(视频 90%,文本 75%)是否仍能提升特征学习效果?
  • RQ3掩码的视频-文本对能否作为对比学习(VTC)和匹配学习(VTM)的有效数据增强手段?
  • RQ4与在更大数据集上预训练的现有方法相比,SimVTP 在多大程度上实现了数据高效性?
  • RQ5在掩码自编码设置下,编码器初始化方式如何影响视频-文本预训练的性能表现?

主要发现

  • SimVTP 仅使用 WebVid-2M 的 240K(10%)样本即在 MSRVTT 上达到 43.8% R@1,优于近期在更大数据集(如 CC3M 和 WebVid-2M)上预训练的 SOTA 方法。
  • 在 90% 视频掩码和 75% 文本掩码比例下,SimVTP 达到最优性能,表明高掩码比例因跨模态信号的辅助而具有显著优势。
  • 在掩码视频-文本对上应用 VTC 和 VTM 显著提升性能,其中在掩码输入上应用 VTC 可达 36.8% R@1,超越在完整数据上训练的方法。
  • 使用 VideoMAE 预训练权重(Kinetics-400 或 ImageNet-1K)进行编码器初始化,性能优于 BERT 或监督微调的 ImageNet-21K 权重。
  • 交叉注意力可视化结果表明,名词和动词标记均能关注到相关视觉区域,证明了有效的跨模态对齐。
  • 模型能重建出更合理且通常比原始描述更准确的文本描述,表明其具备鲁棒且有意义的表征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。