[论文解读] LaFTer: Label-Free Tuning of Zero-shot Classifier using Language and Unlabeled Image Collections
LaFTer 提出了一种无需标签、参数高效的微调方法,仅使用大型语言模型(LLM)生成的文本描述和无标签图像集合,对零样本视觉-语言模型进行微调。通过在 LLM 生成的描述上训练一个仅文本的分类器,并利用其为图像伪标签化,LaFTer 在基础 CLIP 上实现了最高达 11.7% 的绝对准确率提升,且在不使用任何标注数据的情况下,性能达到或超过少样本基线方法。
Recently, large-scale pre-trained Vision and Language (VL) models have set a new state-of-the-art (SOTA) in zero-shot visual classification enabling open-vocabulary recognition of potentially unlimited set of categories defined as simple language prompts. However, despite these great advances, the performance of these zeroshot classifiers still falls short of the results of dedicated (closed category set) classifiers trained with supervised fine tuning. In this paper we show, for the first time, how to reduce this gap without any labels and without any paired VL data, using an unlabeled image collection and a set of texts auto-generated using a Large Language Model (LLM) describing the categories of interest and effectively substituting labeled visual instances of those categories. Using our label-free approach, we are able to attain significant performance improvements over the zero-shot performance of the base VL model and other contemporary methods and baselines on a wide variety of datasets, demonstrating absolute improvement of up to 11.7% (3.8% on average) in the label-free setting. Moreover, despite our approach being label-free, we observe 1.3% average gains over leading few-shot prompting baselines that do use 5-shot supervision.
研究动机与目标
- 在不使用任何标注数据的前提下,弥合零样本视觉-语言模型与监督分类器之间的性能差距。
- 仅使用文本嵌入和无标签图像,实现视觉-语言模型的参数高效微调。
- 证明仅通过文本训练的跨模态迁移可有效提升视觉分类性能。
- 在 12 个多样化的基准上实现无标签微调的最先进结果。
- 尽管使用零个标注样本,仍优于依赖每类 5 个标注样本的少样本提示基线方法。
提出的方法
- 使用大型语言模型(LLM)和手工设计的模板,为目标类别生成多样化的文本描述,构建仅文本的数据集。
- 在生成的文本数据集上训练一个轻量级文本分类器,以预测源类别标签,利用视觉-语言模型共享的文本-图像嵌入空间。
- 使用预训练的文本分类器为无标签图像集合分配伪标签。
- 通过视觉提示微调和自适应归一化层(缩放/偏移)以参数高效的方式微调 CLIP 视觉编码器。
- 应用受 FixMatch 启发的伪标签化流程,以在无监督适应过程中提升鲁棒性并减少过拟合。
- 将微调后的视觉编码器与文本分类器结合用于最终推理,实现对新类别的零样本泛化能力。

实验结果
研究问题
- RQ1在不使用任何无标签图像的前提下,能否通过在 LLM 生成的描述上训练的仅文本分类器,有效迁移以提升视觉分类性能?
- RQ2仅使用无标签图像和合成文本进行无监督微调,能在多大程度上提升零样本视觉-语言模型的性能?
- RQ3LLM 生成描述的多样性在无标签设置下对最终分类准确率有何影响?
- RQ4无标签方法能否超越依赖每类 5 个标注样本的少样本提示方法?
- RQ5不同架构组件(如视觉提示、归一化适应)对无标签微调流程整体性能的影响如何?
主要发现
- LaFTer 在无标签设置下,相对于基础 CLIP 模型,最高实现 11.7% 的绝对准确率提升,平均提升 3.8%,优于先前的最先进方法。
- 该方法平均提升零样本性能 6.7%,在 EuroSAT 等个别基准上最高提升达 28%。
- 尽管未使用任何标注数据,LaFTer 的性能仍与 5-shot 少样本提示基线方法的平均性能持平或超越。
- 仅文本预训练组件贡献显著,当与伪标签化结合时,在 EuroSAT 上可实现最高达 4.2% 的绝对准确率提升。
- 移除关键组件(如文本分类器或视觉提示)会导致性能显著下降(例如,无视觉提示时下降 4.2 个百分点)。
- TSNE 可视化显示,LaFTer 改进了类间分离度,并使文本嵌入在共享嵌入空间中更紧密地对齐视觉聚类。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。