[论文解读] CLIPA-v2: Scaling CLIP Training with 81.1% Zero-shot ImageNet Accuracy within a \$10,000 Budget; An Extra \$4,000 Unlocks 81.8% Accuracy
CLIPA-v2 在预训练和微调阶段均引入了一种反向缩放定律,实现了高性能 CLIP 模型的高效训练。通过利用这一洞察,作者在 10,000 美元预算内使用 H/14 模型实现了 81.1% 的零样本 ImageNet 准确率,优于以往最佳结果 1.0%,训练成本降低约 39 倍;额外投入 4,000 美元后,准确率进一步提升至 81.8%。
The recent work CLIPA presents an inverse scaling law for CLIP training -- whereby the larger the image/text encoders used, the shorter the sequence length of image/text tokens that can be applied in training. This finding enables us to train high-performance CLIP models with significantly reduced computations. Building upon this work, we hereby present CLIPA-v2 with two key contributions. Technically, we find this inverse scaling law is also applicable in the finetuning stage, enabling further reduction in computational needs. Empirically, we explore CLIPA at scale, extending the experiments up to the H/14 model with ~13B image-text pairs seen during training. Our results are exciting -- by only allocating a budget of \$10,000, our CLIP model achieves an impressive zero-shot ImageNet accuracy of 81.1%, surpassing the prior best CLIP model (from OpenCLIP, 80.1%) by 1.0% and meanwhile reducing the computational cost by ~39X. Moreover, with an additional investment of $4,000, we can further elevate the zero-shot ImageNet accuracy to 81.8%. Our code and models are available at https://github.com/UCSC-VLAA/CLIPA.
研究动机与目标
- 将反向缩放定律从预训练阶段扩展至微调阶段,以进一步降低 CLIP 训练的计算成本。
- 将 CLIP 训练扩展至更大模型(最高至 H/14)、更大数据集(最高至 DataComp-1B)以及更长的训练周期(约 130 亿样本)。
- 在受限的 10,000 美元预算内实现最先进的零样本 ImageNet 准确率,使更广泛的用户能够访问高性能 CLIP 模型。
- 研究掩码策略与渐进式微调对模型性能与效率的影响。
- 在零样本分类、检索与鲁棒性基准上,对比 CLIPA-v2 与 OpenCLIP 及其他 SOTA 模型的性能。
提出的方法
- 在预训练和微调阶段均应用反向缩放定律,使更大模型可在不损失性能的前提下使用更少的输入标记。
- 在渐进式微调调度中,前 5.12 亿样本使用 $224^2$ 分辨率进行 30% 随机掩码,后 1.28 亿样本使用 $336^2$ 分辨率进行 40% 掩码。
- 在 LAION-2B 和 DataComp-1B 数据集上训练 H/14 模型,预训练阶段使用 $84^2$ 大小的图像标记,微调阶段使用 $224^2$/$336^2$ 大小的图像标记。
- 通过在预训练阶段减少序列长度来优化训练效率,同时保持高准确率,利用反向缩放行为。
- 实施两阶段微调策略:第一阶段使用较低分辨率和掩码,第二阶段使用更高分辨率和更低的初始学习率。
- 以 JAX 和 PyTorch 格式开源训练好的模型,以支持可复现性与进一步研究。
实验结果
研究问题
- RQ1在 CLIPA 预训练中观察到的反向缩放定律是否可扩展至微调阶段,以进一步降低计算成本?
- RQ2扩大模型规模(最高至 H/14)、数据量(最高至 DataComp-1B)和训练周期(约 130 亿样本)对零样本 ImageNet 准确率有何影响?
- RQ3在微调阶段,掩码策略、分辨率与学习率调度的最优组合为何,可最大化准确率与效率?
- RQ4在零样本准确率、鲁棒性与训练成本方面,CLIPA-v2 与 OpenCLIP 及其他 SOTA 模型相比表现如何?
- RQ5数据来源(LAION-2B 与 DataComp-1B)和分辨率渐进过程在多大程度上影响检索与分类性能?
主要发现
- CLIPA-v2 在 10,000 美元预算内使用 H/14 模型实现 81.1% 的零样本 ImageNet 准确率,优于 OpenCLIP 的 80.1%,提升 1.0%。
- 与之前最佳 CLIP 模型(OpenCLIP G/14)相比,该模型将训练成本降低了约 39 倍。
- 额外投入 4,000 美元后,通过更高分辨率的预训练和渐进式微调,零样本 ImageNet 准确率提升至 81.8%。
- 采用 $224^2$ 和 $336^2$ 分辨率及 30%/40% 掩码率的渐进式微调,相比全分辨率微调,准确率提升 0.2%,速度提升 1.5 倍。
- 81.8% 的 H/14 模型在所有鲁棒性基准上均优于 OpenCLIP 的 80.1% G/14 模型:IN-V2(+2.0%)、IN-A(+13.3%)、IN-R(+2.2%)、ObjectNet(+4.4%)和 IN-SK(+3.9%)。
- 尽管在零样本分类与鲁棒性方面表现更优,OpenCLIP 的 G/14 模型在 COCO 和 Flickr30k 的零样本检索任务中仍占优,表明数据分布差异更有利于检索性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。