[论文解读] SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training
SMAUG 提出了一种稀疏掩码自编码器框架,通过联合掩码视觉和文本标记,并应用时空标记稀疏化技术,显著降低了计算成本,实现了高效的视频-语言预训练。该方法在六个基准测试中实现了最先进或具有竞争力的性能,文本到视频检索和视频问答任务表现优异,预训练速度提升1.9倍,仅需约50个NVIDIA A6000 GPU小时。
Video-language pre-training is crucial for learning powerful multi-modal representation. However, it typically requires a massive amount of computation. In this paper, we develop SMAUG, an efficient pre-training framework for video-language models. The foundation component in SMAUG is masked autoencoders. Different from prior works which only mask textual inputs, our masking strategy considers both visual and textual modalities, providing a better cross-modal alignment and saving more pre-training costs. On top of that, we introduce a space-time token sparsification module, which leverages context information to further select only "important" spatial regions and temporal frames for pre-training. Coupling all these designs allows our method to enjoy both competitive performances on text-to-video retrieval and video question answering tasks, and much less pre-training costs by 1.9X or more. For example, our SMAUG only needs about 50 NVIDIA A6000 GPU hours for pre-training to attain competitive performances on these two video-language tasks across six popular benchmarks.
研究动机与目标
- 降低当前视频-语言预训练所需的计算成本,后者通常需要在多张GPU上训练数周。
- 通过在预训练过程中识别并移除无信息量的空间块和时间上不相关的帧,缓解视频数据中的冗余问题。
- 通过在掩码自编码器框架中联合掩码视觉和文本模态,实现在不损失性能的前提下提升效率。
- 实现可扩展且成本低廉的预训练,同时在下游任务(如文本到视频检索和视频问答)中保持强大的迁移性能。
提出的方法
- 对视觉和文本模态均应用掩码自编码器(MAE),掩码高达75%的图像块和帧,以减少预训练期间的计算量。
- 引入一种时空标记稀疏化模块,利用注意力权重识别并仅保留每帧中最 informative 的空间块。
- 实现一种可学习的基于Transformer的帧选择器,从视频片段中动态选择关键帧,以减少时间冗余。
- 使用掩码视觉建模(MVM)和掩码语言建模(MLM)进行模型训练,重建被掩码的视觉块和文本标记。
- 采用轻量级解码器重建被掩码的块和标记,仅在可见且显著的标记上进行高效训练。
- 结合联合掩码与稀疏化策略,在保持跨模态对齐和表征质量的同时,显著减少预训练时间。
实验结果
研究问题
- RQ1在掩码自编码器框架中联合掩码视觉与文本模态,是否能显著降低预训练成本,同时保持性能?
- RQ2在不降低模型性能的前提下,视频数据中的空间与时间冗余可被去除到何种程度?
- RQ3可学习的帧选择器在识别预训练所需的关键帧方面有多高效,其对计算效率有何影响?
- RQ4所提出的稀疏化策略是否能在多个基准测试中实现1.9倍的预训练时间加速,同时保持最先进性能?
主要发现
- SMAUG 将预训练时间减少1.9倍,在六个视频-语言基准测试中实现具有竞争力的性能,仅需约50个NVIDIA A6000 GPU小时。
- 在视觉标记稀疏化中采用0.8的保留率,将预训练时间从53.8小时减少至50.4小时,MSRVTT数据集上R@1仅下降0.5%。
- 从4帧中选择2帧(4→2)将预训练时间从82.5小时减少至77.8小时,R@1性能仅下降0.5%。
- 完整SMAUG流程(MAE + VTS + FS)将预训练时间从144.5小时减少至77.8小时(1.9倍加速),R@1仅下降1.4%。
- 在包含1700万视频-文本样本的语料库上,SMAUG在R@1上比Singularity高出2.5%,同时节省87.1个GPU小时,展现出强大的可扩展性。
- 定性结果表明,帧选择器能有效识别与字幕对齐的相关帧,且模型即使在50%掩码率下也能生成可靠的像素重建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。