Skip to main content
QUICK REVIEW

[论文解读] VLM: Task-agnostic Video-Language Model Pre-training for Video Understanding

Hu Xu, Gargi Ghosh|arXiv (Cornell University)|May 20, 2021
Multimodal Machine Learning Applications参考文献 34被引用 6
一句话总结

本文提出 VLM,一种任务无关的视频-语言预训练框架,采用单一的 BERT 风格编码器联合处理视频和文本输入。通过引入掩码模态建模(MMM)和统一的掩码标记损失,VLM 实现了有效的跨模态融合,同时保持了单模态能力,在检索和字幕生成任务上实现了最先进性能,且参数量显著少于先前方法。

ABSTRACT

We present a simplified, task-agnostic multi-modal pre-training approach that can accept either video or text input, or both for a variety of end tasks. Existing pre-training are task-specific by adopting either a single cross-modal encoder that requires both modalities, limiting their use for retrieval-style end tasks or more complex multitask learning with two unimodal encoders, limiting early cross-modal fusion. We instead introduce new pretraining masking schemes that better mix across modalities (e.g. by forcing masks for text to predict the closest video embeddings) while also maintaining separability (e.g. unimodal predictions are sometimes required, without using all the input). Experimental results show strong performance across a wider range of tasks than any previous methods, often outperforming task-specific pre-training. Code is made available at https://github.com/pytorch/fairseq/tree/main/examples/MMPT.

研究动机与目标

  • 开发一种统一的、任务无关的视频-语言理解预训练框架,支持多样化的下游任务,而无需任务特定的架构。
  • 克服现有方法的局限性:要么依赖单一跨模态编码器(限制单模态使用),要么使用多个单模态编码器(需要复杂的多任务训练)。
  • 通过引入新的掩码策略,在预训练阶段有效学习跨模态融合,强制模态间依赖关系,同时保持单模态输入的可分性。
  • 证明单一轻量级编码器可在检索和字幕生成基准上超越更大、任务特定的模型。

提出的方法

  • 提出一种掩码模态模型(MMM),在部分训练样本中随机掩码整个模态(文本或视频),迫使模型利用另一模态重建被掩码的模态。
  • 采用统一的掩码标记损失,利用双模态的联合嵌入来预测被掩码的标记,替代对视频和文本分别使用的损失函数。
  • 使用单一的基于 BERT 的 Transformer 编码器,将拼接的视频和文本标记在共享潜在空间中进行处理,实现端到端的联合表征学习。
  • 在微调阶段应用任务特定的注意力掩码,将同一预训练编码器适配至检索、字幕生成等任务。
  • 使用交替的 MFM-MLM 和 MMM 策略,在大规模视频-文本对上进行预训练。
  • 通过允许在双模态均存在时进行单模态预测,保持模型的可分性,确保与检索和生成任务的兼容性。

实验结果

研究问题

  • RQ1能否以任务无关的方式预训练一个统一的视频-语言模型,以支持检索和字幕等多样化下游任务?
  • RQ2如何在不牺牲单模态能力或不依赖复杂多任务目标的前提下,有效学习预训练阶段的跨模态融合?
  • RQ3与标准的掩码帧和掩码语言建模相比,掩码整个模态(MMM)是否能提升联合表征学习效果?
  • RQ4统一的掩码标记损失是否优于对视频和文本分别使用的损失函数,以学习联合表征?
  • RQ5更小的统一编码器是否能在视频理解基准上实现优于更大、任务特定模型的性能?

主要发现

  • 尽管模型参数更少,VLM 在基于文本的视频检索任务上(YouCook2 数据集上 R@1: 27.05)优于任务特定的预训练基线模型超过 2%,在视频字幕任务上(CIDEr: 1.3869)也优于基线模型 1%,表现更优。
  • 消融实验表明,若移除 MMM(即仅使用 MFM-MLM),R@1 降至 15.12,表明 MMM 对有效跨模态学习至关重要。
  • 使用统一的掩码标记损失可提升性能,相较于单独使用 MFM-MLM 损失,R@1 从 26.93 提升至 27.05。
  • 即使在较长视频片段(最少 16 个文本标记)上进行微调,模型仍保持强劲性能,尽管略有下降,表明在更短片段上预训练可能更有效。
  • 可视化结果表明,注意力头学习到了有意义的跨模态对齐,例如词级共指(如 'soy' 与倒酱油动作的视频帧对齐),表明实现了有效的跨模态推理。
  • 与先前方法相比,该模型以显著更少的参数量实现了具有竞争力的结果,证明了更高的参数效率以及模态间更好的特征共享。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。