[论文解读] EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
EVA-CLIP-18B 是一个参数量达 180 亿的对比语言-图像自监督预训练模型,在 27 个图像分类基准上实现了 80.7% 的最先进零样本准确率,尽管仅使用来自 LAION-2B 和 COYO-700M 的 60 亿个训练样本,仍展现出随着模型规模扩大而持续提升的性能。该模型采用 EVA 风格的弱到强视觉表征扩展方法,在图像、视频和 3D 表征学习方面均取得了最先进结果,且公开提供了模型权重。
Scaling up contrastive language-image pretraining (CLIP) is critical for empowering both vision and multimodal models. We present EVA-CLIP-18B, the largest and most powerful open-source CLIP model to date, with 18-billion parameters. With only 6-billion training samples seen, EVA-CLIP-18B achieves an exceptional 80.7% zero-shot top-1 accuracy averaged across 27 widely recognized image classification benchmarks, outperforming its forerunner EVA-CLIP (5-billion parameters) and other open-source CLIP models by a large margin. Remarkably, we observe a consistent performance improvement with the model size scaling of EVA-CLIP, despite maintaining a constant training dataset of 2-billion image-text pairs from LAION-2B and COYO-700M. This dataset is openly available and much smaller than the in-house datasets (e.g., DFN-5B, WebLI-10B) employed in other state-of-the-art CLIP models. EVA-CLIP-18B demonstrates the potential of EVA-style weak-to-strong visual model scaling. With our model weights made publicly available, we hope to facilitate future research in vision and multimodal foundation models.
研究动机与目标
- 将 CLIP 模型扩展至前所未有的规模(180 亿参数),同时在多样化视觉基准上保持高性能。
- 探究在不增加训练数据量的前提下,通过模型规模扩大是否能持续获得性能提升。
- 验证 EVA 风格的弱到强视觉表征扩展方法在大规模对比自监督预训练中的有效性。
- 证明更大的 CLIP 模型可在图像、视频和 3D 表征学习中实现更优的零样本性能。
- 发布一个强大且开源的基础模型,以加速视觉与多模态 AI 领域的研究。
提出的方法
- 模型在从 LAION-2B 和 COYO-700M 收集的 20 亿组图像-文本对精选数据集上,采用对比学习目标进行训练,未使用任何自有数据。
- EVA-CLIP-18B 采用参数量为 180 亿的视觉 Transformer 主干网络,使用 360 张 A100 GPU,全局批量大小为 108,000 进行训练。
- 模型采用双流架构,包含独立的视觉和文本编码器,通过对比损失联合优化,实现图像与文本嵌入的对齐。
- 训练过程包含数据增强和混合精度训练,以提升收敛速度与训练效率。
- 在 27 个图像分类、4 个视频分类和 2 个检索基准上,采用零样本迁移协议对模型进行评估。
- 在多个分辨率(224×224、336×336、448×448)下对模型进行微调与评估,以研究输入分辨率的影响。

实验结果
研究问题
- RQ1将 CLIP 模型扩展至 180 亿参数是否能在固定数据集规模下,持续提升在多样化视觉基准上的性能?
- RQ2EVA 风格的弱到强视觉表征扩展原理是否可有效应用于大规模 CLIP 模型,以实现最先进性能?
- RQ3EVA-CLIP-18B 在零样本图像、视频和 3D 分类任务中,与其它开源及专有 CLIP 模型相比表现如何?
- RQ4提升输入分辨率对 EVA-CLIP-18B 及其较小版本的零样本准确率有何影响?
- RQ5在预训练阶段引入视频数据是否能提升零样本视频分类性能?
主要发现
- EVA-CLIP-18B 在 27 个广泛使用的图像分类基准上,实现了 80.7% 的新最先进零样本 top-1 准确率。
- 尽管仅使用 60 亿个训练样本,EVA-CLIP-18B 仍显著优于其 50 亿参数的前代模型及其他开源 CLIP 模型。
- 即使训练数据量保持恒定(20 亿组图像-文本对),模型性能仍随规模扩大而持续提升。
- 在 ImageNet-1K 上的线性探测中,EVA-CLIP-18B 达到 88.9% 的 top-1 准确率,较 InternVL-C 提升 0.7 个百分点。
- 在 3D 表征学习中,EVA-CLIP-18B 作为教师模型,在 ModelNet40 和 ScanObjectNN 上分别实现 87.6% 和 65.3% 的 top-1 准确率,显著提升零样本性能。
- 在预训练阶段加入视频数据,使 EVA-CLIP-18B 在 Kinetics 和 UCF-101 基准上的零样本视频分类准确率分别提升 +0.7(1 帧)和 +0.8(8 帧)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。