[论文解读] Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models
本文提出梯度调节元提示学习(GRAM),一种模型无关的框架,通过仅使用无标签图文对,联合学习最优软提示初始化与轻量级梯度调节函数。GRAM通过降低对初始化的敏感性并防止对领域特定偏见的过拟合,提升少样本泛化能力,在11个数据集上持续提升性能,实现文本与视觉提示调优的协同增强。
Prompt tuning, a recently emerging paradigm, enables the powerful vision-language pre-training models to adapt to downstream tasks in a parameter -- and data -- efficient way, by learning the ``soft prompts'' to condition frozen pre-training models. Though effective, it is particularly problematic in the few-shot scenario, where prompt tuning performance is sensitive to the initialization and requires a time-consuming process to find a good initialization, thus restricting the fast adaptation ability of the pre-training models. In addition, prompt tuning could undermine the generalizability of the pre-training models, because the learnable prompt tokens are easy to overfit to the limited training samples. To address these issues, we introduce a novel Gradient-RegulAted Meta-prompt learning (GRAM) framework that jointly meta-learns an efficient soft prompt initialization for better adaptation and a lightweight gradient regulating function for strong cross-domain generalizability in a meta-learning paradigm using only the unlabeled image-text pre-training data. Rather than designing a specific prompt tuning method, our GRAM can be easily incorporated into various prompt tuning methods in a model-agnostic way, and comprehensive experiments show that GRAM brings about consistent improvement for them in several settings (i.e., few-shot learning, cross-domain generalization, cross-dataset generalization, etc.) over 11 datasets. Further, experiments show that GRAM enables the orthogonal methods of textual and visual prompt tuning to work in a mutually-enhanced way, offering better generalizability beyond the uni-modal prompt tuning methods.
研究动机与目标
- 解决提示调优中的初始化敏感问题,即不同软提示初始化导致性能显著差异。
- 缓解少样本学习中因提示调优过度拟合于有限训练数据中的虚假相关性而导致的泛化能力下降。
- 实现对冻结视觉-语言模型的快速适应,仅需极少标注数据即可迁移到新任务。
- 开发一种模型无关的方法,以互补且相互增强的方式提升文本与视觉提示调优。
- 利用大规模无标签图文数据进行元学习,无需依赖监督式元训练任务。
提出的方法
- 提出跨模态分层聚类(CHC)算法,基于文本与图像内容将无标签图文数据组织为语义主题与子领域。
- 通过从同一语义主题内的不同领域采样支持集与查询集,模拟元训练中的领域偏移,构建多样化的少样本元任务。
- 通过最小化查询集上的泛化误差的元优化目标,联合元学习软提示初始化与梯度调节函数。
- 引入轻量级梯度调节函数,将原始微调梯度转换为在不同领域间保持一致且具有领域泛化能力的方向。
- 仅使用互联网上的无标签图文对作为元训练数据,避免依赖标注数据集进行元学习。
- 通过模型无关性,支持与多种提示调优方法的即插即用集成,包括CoOp(文本)与VPT(视觉)等。
实验结果
研究问题
- RQ1能否通过无标签图文数据的元学习改善软提示初始化,以降低少样本适应中的敏感性?
- RQ2梯度调节函数能否缓解提示调优过程中对领域特定模式的过拟合,并增强跨领域泛化能力?
- RQ3GRAM是否能实现文本与视觉提示调优之间的更好协同效应,优于联合调优或单独方法?
- RQ4仅使用无标签数据进行元训练时,GRAM的性能相较于监督式元训练或在标注数据上预训练的效果如何?
- RQ5提示标记数量对基础类别性能与新类别泛化能力之间平衡的影响是什么?
主要发现
- GRAM显著降低不同随机初始化下的性能波动,证明其对软提示初始化具有鲁棒性。
- 梯度调节函数可防止训练过程中的性能下降,如CoOp+GRAM在新类别上保持高准确率,而CoOp单独使用时显著下降。
- GRAM相较基线在新类别上实现15%的相对准确率提升,其中梯度调节函数是该改进的主要贡献者。
- 使用无标签数据进行元训练优于使用监督数据集(如WebVision),表明大规模、多样化的无标签数据在元学习中更具优势。
- 通过GRAM联合元学习文本与视觉提示,实现相互增强的性能增益,优于直接联合调优两种提示类型。
- 当提示标记数量超过4个时,新类别的泛化性能下降,4个标记在基础类别与新类别准确率之间达到最佳平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。