[论文解读] Data-free Multi-label Image Recognition via LLM-powered Prompt Tuning
该论文提出了一种无需训练数据的多标签图像识别框架,利用预训练的大语言模型(如ChatGLM)生成物体属性和关系的丰富文本描述,以此学习分层提示(prompt)以微调CLIP,且无需任何训练数据。该方法在MS-COCO数据集上相比零样本基线方法实现了4.7% mAP的性能提升,达到当前最先进水平,证明了在数据稀缺场景下,由大语言模型驱动的提示微调具有显著有效性。
This paper proposes a novel framework for multi-label image recognition without any training data, called data-free framework, which uses knowledge of pre-trained Large Language Model (LLM) to learn prompts to adapt pretrained Vision-Language Model (VLM) like CLIP to multilabel classification. Through asking LLM by well-designed questions, we acquire comprehensive knowledge about characteristics and contexts of objects, which provides valuable text descriptions for learning prompts. Then we propose a hierarchical prompt learning method by taking the multi-label dependency into consideration, wherein a subset of category-specific prompt tokens are shared when the corresponding objects exhibit similar attributes or are more likely to co-occur. Benefiting from the remarkable alignment between visual and linguistic semantics of CLIP, the hierarchical prompts learned from text descriptions are applied to perform classification of images during inference. Our framework presents a new way to explore the synergies between multiple pre-trained models for novel category recognition. Extensive experiments on three public datasets (MS-COCO, VOC2007, and NUS-WIDE) demonstrate that our method achieves better results than the state-of-the-art methods, especially outperforming the zero-shot multi-label recognition methods by 4.7% in mAP on MS-COCO.
研究动机与目标
- 为解决在无任何训练数据的情况下识别多标签图像中新型物体类别这一挑战。
- 探索预训练视觉-语言模型(CLIP)与大语言模型(LLMs)之间的协同作用,以实现零样本适应。
- 通过将物体关系与共享属性融入提示学习,提升多标签识别性能。
- 开发一种利用大语言模型生成知识的提示微调策略,且无需依赖标注图像。
提出的方法
- 向大语言模型(如ChatGLM)提出多样化的提问类型(如类别无关、类别特定、关系导向),以提取物体的全面属性与上下文知识。
- 利用大语言模型作为替代训练数据,生成关于物体属性(如形状、颜色、材质)和物体间关系(如场景中的共现关系)的丰富文本描述。
- 提出一种分层提示学习方法,包含三种标记类型:全局共享标记、用于共现或相似类别的部分共享标记,以及类别特定标记。
- 使用大语言模型生成的文本描述作为监督信号,训练分层提示,利用CLIP的视觉-语言对齐能力进行推理。
- 通过可学习权重整合全局与局部提示分支,优化共享知识与特定知识之间的平衡。
- 在推理阶段应用学习到的提示进行图像分类,无需在真实图像数据上进行微调。
实验结果
研究问题
- RQ1大语言模型生成的文本知识能否有效替代真实训练数据,用于多标签图像识别中的提示微调?
- RQ2如何有效将物体关系与共享属性编码进可学习提示中,以提升多标签分类性能?
- RQ3在捕捉多标签依赖关系方面,提示标记的最优分层结构(全局、部分共享、类别特定)是什么?
- RQ4与使用人工编写描述或真实训练数据的方法相比,大语言模型驱动的提示微调性能如何?
主要发现
- 所提方法在MS-COCO数据集上达到66.8 mAP,相比之前最先进零样本方法提升4.7% mAP,证明了其在无数据场景下的强大性能。
- 该方法在VOC2007、MS-COCO和NUS-WIDE数据集上均超越所有无监督及无标注训练基线,证实了大语言模型生成知识的有效性。
- 性能对提示标记数量的变化具有鲁棒性,最优性能在总标记数为32时达到,超过此数量后性能开始下降。
- 全局与局部提示分支的最优平衡点出现在全局提示权重为0.65时,表明其主导作用且与局部提示互补。
- 定性分析显示,分层提示能有效提升对小尺寸或模糊物体的预测性能,尽管在特定情况下,人工设计提示仍表现更优,归因于人类先验知识。
- 该方法性能略逊于完全监督方法,可能由于CLIP预训练数据与下游任务之间存在领域差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。