Skip to main content
QUICK REVIEW

[论文解读] Prompting Large Pre-trained Vision-Language Models For Compositional Concept Learning

Guangyue Xu, Parisa Kordjamshidi|arXiv (Cornell University)|Nov 9, 2022
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本文提出 PromptCompVL,一种参数高效的提示工程框架,通过引入双可学习组件——软提示(soft-prompting)和软嵌入层(soft-embedding layers),增强大规模视觉语言模型(VLMs)在组合零样本学习(CZSL)中的性能。通过这些组件对 CLIP 进行再编程,该模型在 MIT-States 数据集上达到最先进性能,并在基于 CLIP 的基线方法上实现一致改进,证明了联合使用软提示与软嵌入在组合概念学习中的有效性。

ABSTRACT

This work explores the zero-shot compositional learning ability of large pre-trained vision-language models(VLMs) within the prompt-based learning framework and propose a model ( extit{PromptCompVL}) to solve the compositonal zero-shot learning (CZSL) problem. extit{PromptCompVL} makes two design choices: first, it uses a soft-prompting instead of hard-prompting to inject learnable parameters to reprogram VLMs for compositional learning. Second, to address the compositional challenge, it uses the soft-embedding layer to learn primitive concepts in different combinations. By combining both soft-embedding and soft-prompting, extit{PromptCompVL} achieves state-of-the-art performance on the MIT-States dataset. Furthermore, our proposed model achieves consistent improvement compared to other CLIP-based methods which shows the effectiveness of the proposed prompting strategies for CZSL.

研究动机与目标

  • 探究大规模预训练视觉语言模型(VLMs)在基于提示的框架下,其零样本组合学习能力。
  • 解决组合零样本学习(CZSL)中的分布偏移问题,即模型需识别训练期间未见过的新属性-对象组合。
  • 通过引入一种参数高效的提示方法,对 CLIP 进行再编程,而不微调整个模型,以提升 VLM 在 CZSL 中的泛化能力。
  • 探索结合软提示与软嵌入在学习基本概念及其组合方面的有效性。

提出的方法

  • 通过将 CLIP 的硬提示向量替换为可学习的连续提示嵌入,引入软提示,以重新编程模型用于 CZSL。
  • 引入软嵌入层,替代 CLIP 固定的词汇嵌入层,以在训练过程中动态学习并更新基本概念嵌入(例如,'sliced'、'apple')。
  • 使用 CLIP 的预训练图像和文本编码器(ViT-L/14 或 ResNet),并在训练过程中固定它们,仅更新软提示与软嵌入参数。
  • 利用学习到的软嵌入与软提示构建文本输入,形成组合概念(例如,'sliced apple'),随后通过 CLIP 的文本编码器进行编码。
  • 采用对比损失结合余弦相似度计算 logits,并使用交叉熵损失优化软提示与软嵌入参数。
  • 在推理阶段,选择图像与文本嵌入在共享空间中余弦相似度最高的组合标签。

实验结果

研究问题

  • RQ1像 CLIP 这类大规模预训练视觉语言模型,是否能在不微调的情况下泛化至组合零样本学习?
  • RQ2软提示在重新编程 VLM 以完成组合概念学习任务方面有多有效?
  • RQ3为基本概念引入可学习的软嵌入层是否能提升对未见属性-对象组合的泛化能力?
  • RQ4联合使用软提示与软嵌入是否能超越现有基于 CLIP 的提示方法在 CZSL 基准上的表现?

主要发现

  • PromptCompVL 在 MIT-States 数据集的闭世界与开世界 CZSL 设置下均达到最先进性能,优于非 CLIP 及基于 CLIP 的基线方法。
  • 在 MIT-States 数据集上,PromptCompVL 达到最高的已见准确率,并在未见准确率上表现具有竞争力,且在与其他基于 CLIP 的方法(如 COOP 和 CSP)的对比中持续取得改进。
  • 该模型在 MIT-States 上对已见与未见组合均表现出一致的性能提升,表明其在组合学习中对分布偏移具有鲁棒性。
  • 在 UT-Zappos 数据集上,尽管未达到最先进性能,PromptCompVL 在闭世界设置下仍优于其他基于 CLIP 的方法,证明了该提示策略在更广泛领域中的有效性。
  • 消融实验表明,仅使用软提示已显著提升性能,而引入软嵌入后进一步增强了组合泛化能力,超越固定嵌入的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。