[论文解读] Masked Contrastive Pre-Training for Efficient Video-Text Retrieval
本文提出了一种高效的端到端视频-语言预训练框架——掩码对比预训练(MAC),通过在视频和文本中掩码高比例的空间区域,再利用对比学习对齐多模态表征,从而降低计算成本。MAC 在视频-文本检索基准上实现了最先进性能,FLOPs 减少 60%,预训练速度提升 3 倍。
We present a simple yet effective end-to-end Video-language Pre-training (VidLP) framework, Masked Contrastive Video-language Pretraining (MAC), for video-text retrieval tasks. Our MAC aims to reduce video representation's spatial and temporal redundancy in the VidLP model by a mask sampling mechanism to improve pre-training efficiency. Comparing conventional temporal sparse sampling, we propose to randomly mask a high ratio of spatial regions and only feed visible regions into the encoder as sparse spatial sampling. Similarly, we adopt the mask sampling technique for text inputs for consistency. Instead of blindly applying the mask-then-prediction paradigm from MAE, we propose a masked-then-alignment paradigm for efficient video-text alignment. The motivation is that video-text retrieval tasks rely on high-level alignment rather than low-level reconstruction, and multimodal alignment with masked modeling encourages the model to learn a robust and general multimodal representation from incomplete and unstable inputs. Coupling these designs enables efficient end-to-end pre-training: reduce FLOPs (60% off), accelerate pre-training (by 3x), and improve performance. Our MAC achieves state-of-the-art results on various video-text retrieval datasets, including MSR-VTT, DiDeMo, and ActivityNet. Our approach is omnivorous to input modalities. With minimal modifications, we achieve competitive results on image-text retrieval tasks.
研究动机与目标
- 为解决端到端视频-语言预训练中因处理全分辨率视频帧和文本而导致的高计算成本问题。
- 在不损失多模态对齐性能的前提下,减少视频表征中的空间和时间冗余。
- 通过用传统掩码-预测范式替代为针对检索任务定制的掩码-对齐范式,提升预训练效率。
- 通过对比学习,从不完整和掩码的输入中学习鲁棒且可泛化的多模态表征。
- 在极少架构修改和数据需求下,实现强大的视频-文本检索性能。
提出的方法
- 提出一种掩码-对齐范式,替代 MAE 和 BERT 中使用的标准掩码-预测方法。
- 对视频帧实施 60% 的随机空间掩码,对文本实施 15% 的掩码,仅将可见区域输入编码器。
- 采用分治时空自注意力机制,实现在掩码条件下高效注意力计算与更优的时空建模。
- 通过对比学习对齐掩码后的视频和文本视图,在共享嵌入空间中实现高层语义对齐。
- 同时对视频和文本模态进行双重掩码,以增加对齐难度并提升表征鲁棒性。
- 采用简单、即插即用的设计,无需额外数据增强或多尺度融合,即可泛化至图像-文本检索任务。
实验结果
研究问题
- RQ1在视频和文本中掩码高比例的空间与时间区域,是否能在不降低检索性能的前提下提升预训练效率?
- RQ2掩码-对齐的对比学习方法是否在视频-文本检索任务中优于掩码-预测方法?
- RQ3对视频和文本模态同时进行双重掩码,如何影响跨模态对齐与表征质量?
- RQ4在多模态检索设置中,视频与文本的最优掩码比例是多少?其对性能与计算的影响如何?
- RQ5掩码对比预训练框架是否能在减少 FLOPs 和加快训练的同时,实现最先进性能,并保持在其他多模态任务中的有效性?
主要发现
- 与标准端到端方法相比,MAC 将 FLOPs 减少 60%,并使预训练速度提升 3 倍。
- MAC 在 MSR-VTT 上达到 38.9% 的 R@1,以更少数据和更轻量化架构创下新最先进性能。
- 对视频和文本模态同时进行双重掩码,性能优于单重掩码,MSR-VTT 上 R@1 从 35.8% 提升至 36.4%。
- 采用随机掩码与分治时空自注意力的组合优于柱状掩码与无掩码,MSR-VTT 上实现 36.4% R@1、63.8% R@5 和 73.0% R@10。
- 该方法在图像-文本检索任务中也表现出良好泛化能力,无需强数据增强或多尺度融合即可取得具有竞争力的结果。
- 更高的视频掩码比例(60%)和更低的文本掩码比例(15%)为最优,与 MAE 和 BERT 中的信息密度原理一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。