[论文解读] SuS-X: Training-Free Name-Only Transfer of Vision-Language Models
SuS-X 提出了一种无需训练、仅基于名称的视觉语言模型(VLM)适配方法,适用于 CLIP 等模型,通过从类别名称中利用文本到图像模型或检索技术生成的精选支持集(SuS),并结合一种新型推理协议(TIP-X),在 19 个基准测试中实现了最先进的零样本分类准确率,相较于基线 CLIP 最高提升 11.37%。
Contrastive Language-Image Pre-training (CLIP) has emerged as a simple yet effective way to train large-scale vision-language models. CLIP demonstrates impressive zero-shot classification and retrieval on diverse downstream tasks. However, to leverage its full potential, fine-tuning still appears to be necessary. Fine-tuning the entire CLIP model can be resource-intensive and unstable. Moreover, recent methods that aim to circumvent this need for fine-tuning still require access to images from the target distribution. In this paper, we pursue a different approach and explore the regime of training-free "name-only transfer" in which the only knowledge we possess about the downstream task comprises the names of downstream target categories. We propose a novel method, SuS-X, consisting of two key building blocks -- SuS and TIP-X, that requires neither intensive fine-tuning nor costly labelled data. SuS-X achieves state-of-the-art zero-shot classification results on 19 benchmark datasets. We further show the utility of TIP-X in the training-free few-shot setting, where we again achieve state-of-the-art results over strong training-free baselines. Code is available at https://github.com/vishaal27/SuS-X.
研究动机与目标
- 解决零样本 CLIP 在分布偏移的下游任务中性能受限的问题。
- 在无法访问目标任务数据或模型微调的情况下,实现有效的 VLM 适配。
- 开发一种可扩展、灵活的方法,仅需类别名称即可完成适配。
- 仅使用基于名称的支持集,在多样化基准上实现最先进的零样本分类性能。
提出的方法
- 提出 SuS(支持集),一种动态筛选策略,仅使用类别名称即可生成或检索目标类别的图像。
- 利用文本到图像扩散模型(如 Stable Diffusion)或从大规模视觉-语言数据集(如 LAION-5B)中检索,构建支持集。
- 引入 TIP-X,一种无训练的推理协议,利用筛选后支持集作为少样本数据集的代理,实现 VLM 的适配。
- 将 TIP-X 应用于通过查询图像与支持集提示之间的相似性聚合计算类别 logit,避免微调。
- 支持基于参数化(文本到图像生成)和非参数化(图像检索)两种方法构建支持集。
- 预先缓存特定任务的支持集,以实现无需灾难性遗忘的动态任务切换。
![Figure 1 : Training-free name-only transfer. We propose SuS-X , a framework for enhancing the zero-shot transfer abilities of VLMs like CLIP [ 61 ] , BLIP [ 46 ] and TCL [ 76 ] , without training. To achieve this, we propose a novel method TIP-X , which adapts these VLMs using a curated support set](https://ar5iv.labs.arxiv.org/html/2211.16198/assets/x1.png)
实验结果
研究问题
- RQ1是否可以仅使用类别名称而无需目标数据,有效适配视觉语言模型到新下游任务?
- RQ2与微调或数据增强的零样本方法相比,无训练、仅基于名称的适配策略效果如何?
- RQ3基于类别名称生成的合成图像或检索图像能否作为零样本迁移中少样本适配的有效代理?
- RQ4所提出的 TIP-X 框架在零样本和少样本设置下是否优于现有无训练基线方法?
- RQ5SuS-X 在具有不同领域偏移的多样化下游数据集上表现如何?
主要发现
- SuS-X 在 19 个基准数据集上实现了最先进的零样本分类准确率,相较于基线零样本 CLIP,ResNet-50、ResNet-101 和 ViT-B/16 的平均准确率分别提升 4.60%、5.97% 和 11.37%。
- 在 ImageNet 上,SuS-X-LC(使用基于 CLIP 的文本到图像生成)达到 61.89% 的 top-1 准确率,优于基线 ZS-CLIP(60.31%)和全微调(60.35%)。
- 在少样本设置下,TIP-X 超过强的无训练基线方法,在 11 个数据集上实现 68.20% 的平均准确率,超越先前最先进方法。
- 使用其他文本到图像模型(如 Kandinsky2.1、OpenJourney-4)也带来一致性能提升,平均提升最高达 9.03%,证实方法的鲁棒性。
- 微调 SuS-X(SuS-X-F)可进一步提升性能(如 ImageNet 上达 63.22%),但无训练版本依然高效且避免灾难性遗忘。
- 该方法具备可扩展性和动态性:支持集可预先计算并按任务动态切换,无需重新训练,可高效适配罕见或变化的类别。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。