Skip to main content
QUICK REVIEW

[论文解读] SLIP: Self-supervision meets Language-Image Pre-training

Norman Mu, Alexander M. Kirillov|arXiv (Cornell University)|Dec 23, 2021
Domain Adaptation and Few-Shot Learning被引用 13
一句话总结

SLIP 提出了一种多任务学习框架,通过同时在图像视图上进行自监督对比学习以及在 CLIP 风格的图文对比学习上联合预训练视觉变换器(Vision Transformers)。通过结合这两种目标,SLIP 在零样本迁移、线性探测和微调基准测试中均达到最先进性能,相较于自监督方法线性准确率提升 +8.1%,相较于 CLIP 的零样本准确率提升 +5.2%。

ABSTRACT

Recent work has shown that self-supervised pre-training leads to improvements over supervised learning on challenging visual recognition tasks. CLIP, an exciting new approach to learning with language supervision, demonstrates promising performance on a wide variety of benchmarks. In this work, we explore whether self-supervised learning can aid in the use of language supervision for visual representation learning. We introduce SLIP, a multi-task learning framework for combining self-supervised learning and CLIP pre-training. After pre-training with Vision Transformers, we thoroughly evaluate representation quality and compare performance to both CLIP and self-supervised learning under three distinct settings: zero-shot transfer, linear classification, and end-to-end finetuning. Across ImageNet and a battery of additional datasets, we find that SLIP improves accuracy by a large margin. We validate our results further with experiments on different model sizes, training schedules, and pre-training datasets. Our findings show that SLIP enjoys the best of both worlds: better performance than self-supervision (+8.1% linear accuracy) and language supervision (+5.2% zero-shot accuracy).

研究动机与目标

  • 探究自监督学习是否能增强 CLIP 中的语言监督视觉表征学习。
  • 开发一种统一的多任务框架,联合优化自监督和图文对比学习。
  • 评估自监督与语言监督在多样化下游任务和数据集上的协同效应。
  • 评估预训练数据规模、模型大小和训练策略对表征质量的影响。
  • 在未筛选的数据集(如 YFCC15M)上验证 SLIP 的有效性,突破仅在精选 ImageNet 上预训练的局限。

提出的方法

  • SLIP 使用双目标对视觉变换器进行预训练:在图像增强视图上进行对比自监督学习,以及在图像标题对上进行对比图文匹配学习。
  • 模型联合优化两个对比目标:一个针对图像增强(如裁剪、颜色抖动),另一个针对 YFCC15M 中的配对图文样本。
  • 视觉编码器在共享主干网络中处理图像视图和图文对,每个目标使用独立的投影头。
  • 预训练在 YFCC15M 的 1500 万张子集上进行,采用数据增强和混合精度训练,使用 64 块 V100 GPU。
  • 评估在三种设置下进行:零样本迁移(使用文本提示)、线性分类(在冻结特征上)以及端到端微调。
  • 消融研究包括解耦两个目标以及在互不重叠的图像子集上训练,以隔离每种损失的影响。

实验结果

研究问题

  • RQ1将自监督与语言监督结合是否能产生优于单一方法的视觉表征?
  • RQ2自监督能否提升 CLIP 风格的图文预训练在下游任务中的性能?
  • RQ3SLIP 在不同评估协议(零样本、线性探测、微调)下的表现如何?
  • RQ4在未筛选的大规模数据集(如 YFCC15M)上预训练是否能带来优于仅在 ImageNet 上预训练的泛化能力?
  • RQ5模型大小、训练策略和数据处理对 SLIP 性能的影响是什么?

主要发现

  • 在使用 ViT-L 时,SLIP 在 ImageNet 上实现了 47.9% 的零样本准确率,相较于 CLIP 提升 +5.6%,相较于仅自监督预训练提升 +8.1%。
  • 在线性探测中,SLIP 相较于自监督预训练准确率提升 +8.1%,表明其特征质量更优。
  • SLIP 在零样本准确率上比 CLIP 提升 +5.2%,表明自监督能增强语言引导的表征学习。
  • 解耦自监督与文本监督对性能无显著影响,表明联合优化稳定且有效。
  • SLIP 在额外 25 个下游基准测试中泛化良好,零样本和线性评估设置下均保持一致的性能提升。
  • 尽管训练时间更长(30.5 小时 vs. CLIP 的 22.3 小时),SLIP 在预训练后无推理开销,并在 CC3M 和 CC12M 上保持强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。