[论文解读] Dual Modality Prompt Tuning for Vision-Language Pre-Trained Model
该论文提出了一种新型方法——双模态提示微调(DPT),通过联合优化可学习的文本提示和视觉提示,提升少样本视觉-语言分类性能。通过在文本和图像标记之间使用交叉注意力动态生成与类别相关的视觉提示,DPT增强了模型对目标概念的特征聚焦,从而在11个数据集的16-shot设置下实现了79.47%的最先进准确率,显著优于先前方法。
With the emergence of large pre-trained vison-language model like CLIP, transferable representations can be adapted to a wide range of downstream tasks via prompt tuning. Prompt tuning tries to probe the beneficial information for downstream tasks from the general knowledge stored in the pre-trained model. A recently proposed method named Context Optimization (CoOp) introduces a set of learnable vectors as text prompt from the language side. However, tuning the text prompt alone can only adjust the synthesized "classifier", while the computed visual features of the image encoder can not be affected , thus leading to sub-optimal solutions. In this paper, we propose a novel Dual-modality Prompt Tuning (DPT) paradigm through learning text and visual prompts simultaneously. To make the final image feature concentrate more on the target visual concept, a Class-Aware Visual Prompt Tuning (CAVPT) scheme is further proposed in our DPT, where the class-aware visual prompt is generated dynamically by performing the cross attention between text prompts features and image patch token embeddings to encode both the downstream task-related information and visual instance information. Extensive experimental results on 11 datasets demonstrate the effectiveness and generalization ability of the proposed method. Our code is available in https://github.com/fanrena/DPT.
研究动机与目标
- 为解决现有提示微调方法仅优化文本提示而固定图像特征所带来的局限性,这些方法无法有效适应下游任务的视觉表示。
- 通过可学习的视觉提示,使视觉编码器能够聚焦于目标视觉概念,从而提升特征对齐效果。
- 开发一种与类别相关的视觉提示机制,通过文本与图像嵌入之间的交叉注意力,整合任务特定与实例特定的信息。
- 在多样化的少样本视觉基准上,验证双模态提示微调的有效性与泛化能力。
- 证明联合微调两种模态相比仅微调文本或视觉提示,能够获得更优性能。
提出的方法
- 提出一种双模态提示微调(DPT)框架,以端到端方式联合训练语言流中的可学习文本提示(向量)和视觉流中注入图像块标记的可学习视觉提示(向量)。
- 通过在视觉Transformer(ViT)编码器的每个Transformer块之前插入可训练参数,应用视觉提示,利用自注意力机制修改图像块标记的嵌入表示。
- 提出类别感知视觉提示微调(CAVPT),通过文本提示特征与图像块标记嵌入之间的交叉注意力,动态生成视觉提示。
- 利用交叉注意力将下游任务信息(来自文本提示)注入视觉特征,使模型能够更强烈地关注相关视觉概念。
- 保持预训练的图像和文本编码器冻结,仅微调提示参数,从而实现高效适应且参数量极少。
- 采用文本与视觉提示监督的加权组合,其中超参数α控制两种模态之间的平衡。
实验结果
研究问题
- RQ1联合微调文本与视觉提示是否能超越单模态提示微调,在少样本视觉-语言分类任务中取得更优性能?
- RQ2与固定或非感知类别的视觉提示相比,动态生成的、与类别相关的视觉提示是否能更有效地增强对目标视觉概念的注意力?
- RQ3在多样化的少样本数据集上,DPT的性能与零样本CLIP、CoOp及其他提示微调基线方法相比如何?
- RQ4为最大化性能并避免过拟合,视觉提示的最佳长度与配置是什么?
- RQ5DPT的有效性是否能在不同视觉Transformer主干网络(如ViT-B/16与ViT-B/32)上泛化?
主要发现
- 在16-shot设置下,DPT在11个少样本数据集上的平均准确率达到79.47%,创下新SOTA,显著优于零样本CLIP(61.32%)和CoOp(76.02%)。
- 消融实验表明,仅使用视觉提示微调相比CoOp可提升准确率3.45%,而联合微调两种模态可进一步提升0.45%。
- 采用10个视觉提示标记的类别感知视觉提示微调(CAVPT)达到最高平均准确率79.47%,优于较短(5个)和较长(50个)的提示长度。
- 该方法在不同ViT主干网络上均表现出良好泛化能力,DPT在ViT-B/16上达到78.96%,在ViT-B/32上达到79.47%,证实其鲁棒性。
- 可视化结果表明,DPT能更有效地将注意力集中在真实目标对象上,而基线方法如CoOp和零样本CLIP则会突出多个无关对象。
- 在不同α值下的消融实验显示,平衡组合(α=0.5)可获得最优性能,表明两种模态对最终结果均有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。