Skip to main content
QUICK REVIEW

[论文解读] Collaboration of Pre-trained Models Makes Better Few-shot Learner

Renrui Zhang, Bohao Li|arXiv (Cornell University)|Sep 25, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

该论文提出 CoMo,一种少样本学习框架,通过协同预训练模型——CLIP(文本对比)、DINO(视觉对比)和 DALL-E(文本生成)——来提升少样本分类性能。通过 DALL-E 生成合成图像,并利用可学习的多知识适配器自适应集成预测结果,CoMo 在无需额外标注数据的情况下,在 11 个数据集上实现了最先进性能。

ABSTRACT

Few-shot classification requires deep neural networks to learn generalized representations only from limited training images, which is challenging but significant in low-data regimes. Recently, CLIP-based methods have shown promising few-shot performance benefited from the contrastive language-image pre-training. Based on this point, we question if the large-scale pre-training can alleviate the few-shot data deficiency and also assist the representation learning by the pre-learned knowledge. In this paper, we propose CoMo, a Collaboration of pre-trained Models that incorporates diverse prior knowledge from various pre-training paradigms for better few-shot learning. Our CoMo includes: CLIP's language-contrastive knowledge, DINO's vision-contrastive knowledge, and DALL-E's language-generative knowledge. Specifically, CoMo works in two aspects: few-shot data expansion and diverse knowledge ensemble. For one, we generate synthetic images via zero-shot DALL-E to enrich the few-shot training data without any manpower. For the other, we introduce a learnable Multi-Knowledge Adapter (MK-Adapter) to adaptively blend the predictions from CLIP and DINO. By such collaboration, CoMo can fully unleash the potential of different pre-training methods and unify them to perform state-of-the-art for few-shot classification. We conduct extensive experiments on 11 datasets to demonstrate the superiority and generalization ability of our approach.

研究动机与目标

  • 探究结合多种预训练范式是否能缓解少样本学习中的数据稀缺问题。
  • 通过利用 CLIP、DINO 和 DALL-E 的互补知识,提升少样本分类性能。
  • 开发一种仅使用有限标注数据和预训练模型来增强表示学习的方法。
  • 设计一种可学习适配器,以自适应方式融合来自多个预训练模型的预测结果。

提出的方法

  • CoMo 使用零样本 DALL-E,基于与类别相关的文本提示生成合成图像,以扩充少样本训练数据。
  • 它采用带有双键缓存的多知识适配器(MK-Adapter),生成并自适应地组合来自 CLIP 和 DINO 的 logits。
  • MK-Adapter 通过预训练模型输出与 CLIP 的零样本 logits 之间的分布相似性,对预测结果进行重加权。
  • 最终预测结果是 CLIP 的零样本 logits、DINO 的视觉对比 logits 以及 MK-Adapter 融合输出的集成。
  • 仅对轻量级的 MK-Adapter 在扩充后的少样本数据上进行微调,保持预训练模型权重冻结。
  • 该框架在扩充数据上端到端训练,使用交叉熵损失,实现有效的知识蒸馏。

实验结果

研究问题

  • RQ1将具有不同预训练目标的预训练模型相结合,是否能超越单模型基线,在少样本分类中取得更好性能?
  • RQ2从 DALL-E 进行零样本图像生成,是否能有效扩充少样本训练数据而无需人工标注?
  • RQ3对多样化预训练模型预测结果的自适应融合,是否能带来比固定集成策略更好的泛化性能?
  • RQ4CLIP、DINO 和 DALL-E 的协同合作,在多种数据集上与现有少样本学习方法相比表现如何?

主要发现

  • CoMo 在 11 个少样本分类数据集上达到最先进性能,优于现有方法(包括 CLIP-Adapter 和 Tip-Adapter-F)。
  • 在 16-shot ImageNet 上,CoMo 使用 ViT-B/16 达到 74.48% 的 top-1 准确率,领先第二名方法(Tip-Adapter-F)0.79 个百分点。
  • 每类生成 4 张合成图像为最优数量,超过此数量后性能下降,原因是引入了低质量样本。
  • 使用 CLIP 的零样本 logits 作为自适应集成的分布基线时性能最佳,优于平均池化或最大池化策略。
  • t-SNE 可视化显示,CoMo 生成的类别聚类更具可分性和对比性,减少了类别混淆。
  • 学习曲线表明,CoMo 在 20 个训练周期内收敛更快且准确率高于单模型基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。