[论文解读] VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding
VideoCLIP 通过利用时间上重叠的视频-文本片段以及检索增强的负样本采样,提出了一种对比预训练方法,实现了零样本视频-文本理解。该方法在多个视频-文本任务上取得了当前最优的零样本性能,优于以往的零样本方法,甚至超越了部分全监督方法,且无需使用任何下游标签。
We present VideoCLIP, a contrastive approach to pre-train a unified model for zero-shot video and text understanding, without using any labels on downstream tasks. VideoCLIP trains a transformer for video and text by contrasting temporally overlapping positive video-text pairs with hard negatives from nearest neighbor retrieval. Our experiments on a diverse series of downstream tasks, including sequence-level text-video retrieval, VideoQA, token-level action localization, and action segmentation reveal state-of-the-art performance, surpassing prior work, and in some cases even outperforming supervised approaches. Code is made available at https://github.com/pytorch/fairseq/tree/main/examples/MMPT.
研究动机与目标
- 在不微调下游标签的情况下,实现对多样化视频-文本理解任务的零样本迁移。
- 通过使用时间上松散重叠的视频和文本片段(而非严格的时间对齐),提升细粒度的视频-文本对齐效果。
- 通过从检索中获取语义相似的视频聚类作为更难的负样本,改进对比学习中的负样本采样。
- 评估在 HowTo100M 上预训练的统一视频-文本模型是否能在序列级和词元级任务上有效泛化。
- 探究改进正样本和负样本采样后的对比预训练方法是否能在零样本设置下超越监督方法。
提出的方法
- 使用对比目标对统一的 Transformer 模型进行预训练,比较具有时间重叠跨度的视频和文本片段,而非要求精确的起止时间戳对齐。
- 采用检索增强策略,通过基于相似性对视频聚类,构建包含难负样本的批次,提升负样本对的难度。
- 应用对比损失(如 InfoNCE),促使具有时间重叠的正样本对(视频-文本)在嵌入空间中比负样本对更接近。
- 采用双流 Transformer 编码器,视频和文本共享或分别使用编码器,实现联合表示学习。
- 使用最近邻检索从与锚点视频相似的视频中采样难负样本,提升对比目标的难度。
- 使用 HowTo100M 数据集进行预训练,采用原始视频和转录字幕,无需人工标注。
实验结果
研究问题
- RQ1与严格时间对齐相比,使用时间上松散重叠的视频-文本片段的对比预训练方法是否能提升零样本视频-文本理解效果?
- RQ2与随机采样或视频内负样本采样相比,检索增强的负样本采样是否能带来更好的零样本视频-文本任务泛化性能?
- RQ3在 HowTo100M 上预训练的统一视频-文本模型是否能在检索、视频问答(VideoQA)和动作定位等多样化任务上实现当前最优的零样本性能?
- RQ4零样本性能在多大程度上能与在下游数据上微调的全监督模型相媲美或超越?
- RQ5共享编码器、[CLS] 标记使用或检索窗口长度等设计选择如何影响模型性能?
主要发现
- 在 YouCook2 数据集的零样本设置下,VideoCLIP 在文本到视频检索任务中达到 22.7% 的 R@1,优于所有先前的零样本方法,甚至超越了部分全监督模型。
- 若移除检索增强的负样本采样,R@1 降至 18.5%;若同时移除检索和重叠片段,性能进一步降至 12.4%,表明两项组件共同带来了约 50% 的相对性能提升。
- 使用 MIL-NCE 损失并以多段片段作为正样本时,R@1 仅为 16.1%,显著低于 VideoCLIP 的 22.7%,表明所提出的损失函数更有效。
- 模型在动作定位和分割任务上表现优异,展示了在不同粒度的视频-文本对齐任务中强大的零样本泛化能力。
- 使用共享的视频和文本 Transformer 编码器仅导致性能轻微下降(R@1 为 21.9% vs. 22.7%),表明联合建模是有效的。
- 使用视频前 32 秒进行检索的性能更差(R@1 为 20.1%),表明完整视频表示比部分视频表示更具信息量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。