Skip to main content
QUICK REVIEW

[论文解读] CLIP model is an Efficient Continual Learner

Vishal Thengane, Salman Khan|arXiv (Cornell University)|Oct 6, 2022
Multimodal Machine Learning Applications被引用 14
一句话总结

该论文表明,经过冻结的CLIP模型在无需微调、记忆回放或超参数调优的情况下,在ImageNet-100/1K、CIFAR-100、TinyImageNet和CORe50上,于类别增量、域增量和任务无关设置下均实现了最先进的零样本持续学习性能。其强大的泛化能力源于CLIP在4亿张图像-文本对上的对比预训练,性能进一步通过简单的提示工程得到提升。

ABSTRACT

The continual learning setting aims to learn new tasks over time without forgetting the previous ones. The literature reports several significant efforts to tackle this problem with limited or no access to previous task data. Among such efforts, typical solutions offer sophisticated techniques involving memory replay, knowledge distillation, model regularization, and dynamic network expansion. The resulting methods have a retraining cost at each learning task, dedicated memory requirements, and setting-specific design choices. In this work, we show that a frozen CLIP (Contrastive Language-Image Pretraining) model offers astounding continual learning performance without any fine-tuning (zero-shot evaluation). We evaluate CLIP under a variety of settings including class-incremental, domain-incremental and task-agnostic incremental learning on five popular benchmarks (ImageNet-100 & 1K, CORe50, CIFAR-100, and TinyImageNet). Without any bells and whistles, the CLIP model outperforms the state-of-the-art continual learning approaches in the majority of the settings. We show the effect on the CLIP model's performance by varying text inputs with simple prompt templates. To the best of our knowledge, this is the first work to report the CLIP zero-shot performance in a continual setting. We advocate the use of this strong yet embarrassingly simple baseline for future comparisons in the continual learning tasks.

研究动机与目标

  • 评估冻结的CLIP模型是否可在无需任务特定设计或微调的情况下,作为持续学习的强大、通用基线。
  • 评估CLIP在多种持续学习协议(类别增量、域增量和任务无关学习)下的零样本性能。
  • 研究提示工程(包括不同文本提示模板和池化策略)对CLIP持续学习准确率的影响。
  • 建立一种简单、可扩展且无内存负担的基线,超越现有持续学习方法对特定设置的依赖。
  • 通过倡导基础视觉-语言模型作为统一、可泛化的解决方案,挑战当前持续学习领域的碎片化现状。

提出的方法

  • 在持续学习基准上评估预训练且冻结的CLIP模型,采用零样本推理,不进行任何微调或参数更新。
  • 使用文本提示模板来调节CLIP分类头,其中类别名称来源于ImageNet原始标签、人工筛选的标签以及WordNet同义词。
  • 应用两种提示池化策略:基于决策的池化(对不同提示的logits取平均)和嵌入池化(堆叠文本嵌入)。
  • 在五个主要基准上进行测试:ImageNet-100/1K、CORe50、CIFAR-100、TinyImageNet,以及在多种持续学习协议下进行的高斯调度CIFAR-100。
  • 在所有设置下与SOTA持续学习方法进行性能比较,以验证冻结CLIP基线的有效性。
  • 通过分析混淆矩阵识别失败模式,特别是语义相似类别之间的误分类。

实验结果

研究问题

  • RQ1冻结的CLIP模型是否可在无需微调或记忆回放的情况下,在多种协议中实现具有竞争力的持续学习性能?
  • RQ2提示工程(特别是类别名称选择和池化策略)如何影响CLIP的零样本持续学习准确率?
  • RQ3CLIP在4亿张图像-文本对上的预训练是否使其能够泛化到持续学习场景,即使某些下游类别在预训练阶段已出现?
  • RQ4CLIP在多样化的基准和设置下与SOTA持续学习方法相比表现如何?
  • RQ5一个单一、统一、冻结的视觉-语言模型是否可作为类别增量、域增量和任务无关持续学习的稳健基线?

主要发现

  • 在ImageNet-100上,使用人工筛选类别名称和嵌入池化的Continual-CLIP达到了84.85%的准确率,优于同一设置下的SOTA方法。
  • 在ImageNet-1K的类别增量设置中,冻结的CLIP模型未进行任何微调即实现了具有竞争力的性能,表明其在大规模数据集上的可扩展性。
  • 在CORe50的域增量设置中,CLIP表现出强大的泛化能力,表明其在无需微调的情况下对域变化具有鲁棒性。
  • 人工筛选的类别名称(类型b)取得了最高准确率,因其最小化了类别间的语义模糊性,优于原始ImageNet标签和基于同义词的名称。
  • 在ImageNet-100上,嵌入池化(84.85%)略胜于基于决策的池化(82.24%),尽管两者均需提示工程和额外计算开销。
  • 混淆矩阵显示,错误主要发生在语义相似的类别之间(例如,'mouse'被误分类为'weasel'),表明在细粒度视觉-语义对齐方面仍存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。