[论文解读] Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior Refinement
本文提出 APE(自适应先验精炼),一种通过利用类间差异度与方差标准,选择性地精炼最具信息量的视觉特征通道,从而提升 CLIP 在少样本分类中性能的方法。该方法在参数量仅为先前方法 30 分之一的情况下,实现了最先进(SOTA)的准确率,同时提供无需训练的变体与轻量微调版本(APE-T)。
The popularity of Contrastive Language-Image Pre-training (CLIP) has propelled its application to diverse downstream vision tasks. To improve its capacity on downstream tasks, few-shot learning has become a widely-adopted technique. However, existing methods either exhibit limited performance or suffer from excessive learnable parameters. In this paper, we propose APE, an Adaptive Prior rEfinement method for CLIP's pre-trained knowledge, which achieves superior accuracy with high computational efficiency. Via a prior refinement module, we analyze the inter-class disparity in the downstream data and decouple the domain-specific knowledge from the CLIP-extracted cache model. On top of that, we introduce two model variants, a training-free APE and a training-required APE-T. We explore the trilateral affinities between the test image, prior cache model, and textual representations, and only enable a lightweight category-residual module to be trained. For the average accuracy over 11 benchmarks, both APE and APE-T attain state-of-the-art and respectively outperform the second-best by +1.59% and +1.99% under 16 shots with x30 less learnable parameters.
研究动机与目标
- 解决现有少样本 CLIP 方法效率低下且性能有限的问题,这些方法或忽略 CLIP 的预训练知识,或依赖于大参数量的缓存模型。
- 通过选择性地精炼 CLIP 的视觉表征,仅保留最具判别性的特征通道,以提升少样本分类的准确率。
- 在利用 CLIP 的预训练先验知识的同时,通过轻量级、自适应的精炼机制,保持高计算效率。
- 开发两种变体:一种无需训练的 APE,用于快速推理;另一种需要训练的 APE-T,仅微调轻量级类别残差。
- 在 11 个少样本基准上实现最先进性能,且相比先前方法显著减少参数量。
提出的方法
- 提出一种先验精炼模块,基于类间相似度与方差选择显著特征通道,减少 CLIP 视觉特征中的冗余。
- 引入测试图像、精炼后的先验缓存与文本表征之间的三重亲和建模,以增强推理过程的鲁棒性。
- 采用轻量级类别残差模块,仅在精炼后的特征上进行训练,避免对缓存模型进行完整微调。
- 使用平衡因子 λ 和平滑因子 γ 控制精炼过程中类间差异度与特征稳定性的权衡。
- 应用通道级选择机制,动态识别并保留来自基于 ResNet-50 的 CLIP 的 1024 个特征中的最具有判别性的 512 个。
- 利用 GPT-3 和 CuPL 的提示模板,生成多样化的文本描述,以在特征精炼过程中提升视觉-语言对齐效果。
实验结果
研究问题
- RQ1我们能否通过仅选择性地精炼预训练 CLIP 特征中最具信息量的视觉特征通道,来提升少样本 CLIP 的性能?
- RQ2基于类间差异度与方差的自适应通道选择,对下游少样本分类准确率有何影响?
- RQ3能否通过利用精炼后的先验知识,实现无需训练的推理机制,并在极低参数开销下超越现有方法?
- RQ4相较于完整缓存微调,仅在精炼特征上微调轻量级类别残差,其准确率提升程度如何?
- RQ5所提方法在具有不同数据分布与视觉复杂度的多样化少样本基准上,泛化能力如何?
主要发现
- APE 在 11 个基准上的平均 16-shot 准确率达到最先进水平,较第二名方法提升 +1.59%。
- APE-T 在相同 16-shot 设置下,较第二名方法提升 +1.99%,证明其在显著减少参数量的同时仍具备卓越性能。
- 与基于缓存的先前方法相比,该方法将可学习参数量减少了 30 倍,显著提升计算效率。
- 消融研究显示,平衡因子 λ 与平滑因子 γ 对性能有显著影响,最优值分别为 λ=0.6 和 γ=0.15。
- 无需训练的 APE 变体在无任何微调的情况下表现强劲,验证了三重亲和建模的有效性。
- 该方法在多种骨干网络(ResNet-50、ResNet-101、ViT-B/16、ViT-B/32)上均表现出良好泛化能力,所有架构上均保持一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。