[论文解读] Scaling Language-Image Pre-training via Masking
本文提出快速图文预训练(FLIP),通过在预训练过程中随机遮蔽50–75%的图像块,加速CLIP训练,实现更快收敛与更高准确率。FLIP在4亿张图像-文本对上实现最高3.7倍的训练速度提升,同时在多种下游任务中优于CLIP基线模型,通过稀疏计算实现高效的对比学习,展现出速度与性能之间的有利权衡。
We present Fast Language-Image Pre-training (FLIP), a simple and more efficient method for training CLIP. Our method randomly masks out and removes a large portion of image patches during training. Masking allows us to learn from more image-text pairs given the same wall-clock time and contrast more samples per iteration with similar memory footprint. It leads to a favorable trade-off between accuracy and training time. In our experiments on 400 million image-text pairs, FLIP improves both accuracy and speed over the no-masking baseline. On a large diversity of downstream tasks, FLIP dominantly outperforms the CLIP counterparts trained on the same data. Facilitated by the speedup, we explore the scaling behavior of increasing the model size, data size, or training length, and report encouraging results and comparisons. We hope that our work will foster future research on scaling vision-language learning.
研究动机与目标
- 为解决大规模视觉-语言预训练的高运行时间成本,特别是CLIP类模型的训练成本问题。
- 探索在不损害模型准确率的前提下,实现语言-图像预训练的高效扩展策略。
- 通过图像块遮蔽实现稀疏计算,提升训练速度与吞吐量。
- 评估模型规模、数据规模和训练时长对FLIP性能的影响。
- 证明遮蔽机制相比标准CLIP训练,能实现更优的训练速度与准确率权衡。
提出的方法
- 在训练过程中对50–75%的图像块应用随机遮蔽,降低计算负载,同时保留来自文本的语义监督。
- 采用遮蔽图像块与对应文本描述之间的对比学习目标,与CLIP类似。
- 遮蔽可支持高达4倍的批量大小,且内存增加极少,从而提升梯度稳定性与准确率。
- 使用LARS优化器,配合余弦退火学习率衰减、权重衰减及逐层权重学习率衰减,以实现更好收敛。
- 在下游任务(如图像字幕生成、VQA和零样本分类)上,采用标准微调协议进行端到端微调。
- 在ViT编码器之上训练一个序列到序列的Transformer解码器用于图像字幕生成,采用教师强制策略与交叉熵损失。
实验结果
研究问题
- RQ1在预训练过程中对图像块进行遮蔽,是否能显著缩短训练时间而不降低下游性能?
- RQ2遮蔽对对比语言-图像预训练中的准确率与吞吐量权衡有何影响?
- RQ3在使用FLIP方法时,模型规模、数据规模和训练时长的缩放规律是什么?
- RQ4在相同数据上训练并在多样化下游任务上评估时,FLIP是否优于CLIP及其变体?
- RQ5由于计算成本降低,遮蔽是否能实现对大规模预训练更高效的探索?
主要发现
- 在256个TPU-v3核心上,FLIP相比CLIP将运行时间缩短3.7倍,且在更短时间内达到相似准确率。
- 在相同训练轮次下,FLIP在ViT-L/16模型上实现86.1%的零样本ImageNet-1K准确率,优于CLIP的84.8%。
- 在多样化下游任务集合中,基于LAION-400M数据预训练的FLIP在所有基准测试中均优于OpenCLIP和复现的CLIP基线模型。
- 使用FLIP进行数据扩展可在不增加额外训练成本的情况下实现性能提升,表明其具有有利的数据缩放特性。
- 模型缩放与数据缩放均能提升准确率,其中数据缩放尤其是一种高效提升性能的路径。
- FLIP支持高效的图像字幕与VQA微调,在COCO与NoCaps基准上展现出强大的零样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。