[论文解读] Retrieval-Enhanced Visual Prompt Learning for Few-shot Classification
本文提出 RePrompt,一种检索增强的视觉提示学习框架,通过缓存并检索相关训练嵌入来指导提示微调,从而提升少样本图像分类性能。通过在提示学习的多个阶段(输入、中间层和推理阶段)整合检索机制,RePrompt 在 11 个视觉数据集和 4 个域泛化基准上均达到最先进性能,尤其在低样本和高域差距场景下表现突出。
The Contrastive Language-Image Pretraining (CLIP) model has been widely used in various downstream vision tasks. The few-shot learning paradigm has been widely adopted to augment its capacity for these tasks. However, current paradigms may struggle with fine-grained classification, such as satellite image recognition, due to widening domain gaps. To address this limitation, we propose retrieval-enhanced visual prompt learning (RePrompt), which introduces retrieval mechanisms to cache and reuse the knowledge of downstream tasks. RePrompt constructs a retrieval database from either training examples or external data if available, and uses a retrieval mechanism to enhance multiple stages of a simple prompt learning baseline, thus narrowing the domain gap. During inference, our enhanced model can reference similar samples brought by retrieval to make more accurate predictions. A detailed analysis reveals that retrieval helps to improve the distribution of late features, thus, improving generalization for downstream tasks. Reprompt attains state-of-the-art performance on a wide range of vision datasets, including 11 image datasets, 3 video datasets, 1 multi-view dataset, and 4 domain generalization benchmarks.
研究动机与目标
- 解决在少样本和域偏移设置下提示学习泛化能力差的问题,尤其是在类内视觉差异较大的情况下。
- 克服固定或可学习提示模板在适配冻结的视觉-语言模型(如 CLIP)至低资源下游任务时的局限性。
- 通过在提示学习过程中引入检索到的相似样本作为外部知识,提升零样本和少样本性能。
- 通过基于检索的知识注入,实现在仅每类 1–16 张样本的情况下,有效适应未见域。
- 设计一个统一框架,在输入、中间和输出阶段均集成检索机制,并提供端到端训练指导。
提出的方法
- 使用冻结图像编码器的特征(键)及其对应标签或特征(值)构建检索数据库,数据来自少样本训练集。
- 采用最大内积搜索(MIPS)基于查询图像特征检索最相似的 K 个训练样本。
- 通过两种策略将检索到的知识整合到视觉提示学习过程中:(1) 将检索增强的视觉提示插入图像编码器的多个层中;(2) 应用参数化的 k-NN 适配器以优化分类 logits。
- 采用基于检索结果的可微分、基于先验分布的损失函数进行端到端训练,以平衡检索影响与模型置信度。
- 使用 CLIP 的 ViT-B/16 图像编码器作为检索编码器($e_R$),其检索质量优于其他编码器(如 Timm 的 ViT-B/16)。
- 动态调整检索提示插入的深度(J)和温度超参数($\gamma$),以控制检索影响并避免噪声干扰。
实验结果
研究问题
- RQ1当域差距增大时,检索相似训练样本是否能提升少样本视觉提示学习性能?
- RQ2将检索机制集成到提示学习的不同阶段(输入、中间、输出)对模型性能有何影响?
- RQ3检索增强提示插入的最佳深度和温度($\gamma$)为何值?如何在知识增益与噪声之间取得平衡?
- RQ4在分布外和细粒度数据集上,基于检索的提示学习是否比标准提示学习泛化能力更强?
- RQ5类内视觉差异如何影响检索增强提示学习的有效性?
主要发现
- RePrompt 在 11 个少样本视觉数据集上达到最先进性能,包括 FGVC Aircraft、ImageNet 和 Oxford Pets 等具有挑战性的基准,其中在 Oxford Pets 数据集上 16 张样本时准确率最高达 94.58%。
- 在 ImageNet 上,当检索增强提示插入前 3 层时,RePrompt 达到 74.57% 的准确率,优于基线方法 CoOP 和 VLPT。
- 在域泛化基准(ImageNet-Sketch、ImageNet-A、ImageNet-R、ImageNetV2)上,RePrompt 展现出卓越的鲁棒性与泛化能力,证实其在未见域中的有效性。
- 最优插入深度(J)因数据集而异:FGVC Aircraft 为 5 层,ImageNet 为 3 层,Oxford Pets 为 6 层,表明适度的检索集成最为有效。
- 较低的 $\gamma$ 值(更强的检索影响)可提升性能,表明在适当调优下,检索增强始终具有持续益处。
- 使用 CLIP 的 ViT-B/16 作为检索编码器($e_R$)的效果优于 Timm 的监督微调 ViT-B/16,尤其在处理困难样本(如 'velvet fabric')时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。