[论文解读] Prompt Tuning with Soft Context Sharing for Vision-Language Models
本文提出 SoftCPT,一种用于视觉-语言模型的新型多任务提示微调方法,通过共享的元网络从可学习的元提示和任务名称生成特定于任务的、连续可微的共享提示向量。实验表明,SoftCPT 在三个少样本数据集上显著优于 CoOp 和硬提示共享方法,展示了在多任务少样本图像识别中更高的准确率和更强的稳定性。
Vision-language models have recently shown great potential on many tasks in computer vision. Meanwhile, prior work demonstrates prompt tuning designed for vision-language models could acquire superior performance on few-shot image recognition compared to linear probe, a strong baseline. In practice, many few-shot tasks are inherently correlated, particularly within specialized domains. However, such information is overlooked previously. Inspired by the fact that modeling task relationship by multi-task learning can usually boost performance, we propose a novel method SoftCPT (Soft Context Sharing for Prompt Tuning) to tune pre-trained vision-language models on multiple target few-shot tasks jointly. Specifically, we design a task-shared meta network to generate prompt context for each task using task name together with a learnable task context as input. The parameters of this meta network as well as the task context are tuned on the joint training set of all tasks. As such, the prompt context of all tasks will be shared in a soft manner. Extensive experiments across four multi-task few-shot datasets covering 44 tasks and 1593 categories demonstrate that SoftCPT significantly outperforms single-task prompt tuning methods, highlighting the effectiveness of multi-task learning for vision-language prompt tuning. Code is available at https://github.com/kding1225/softcpt.
研究动机与目标
- 为解决少样本视觉-语言学习中单任务提示微调的局限性,通过利用任务间关系进行改进。
- 探索多任务学习是否能提升视觉-语言模型中的提示微调性能,特别是在具有相关任务的专业化领域中。
- 设计一种方法,实现在多个任务之间软性、连续的提示表征共享,而无需硬性约束。
- 通过在相关任务上联合微调提示,提升少样本图像识别的泛化能力与稳定性。
- 验证多任务提示微调是否能优于单任务微调和提示迁移方法。
提出的方法
- 引入一个任务共享的元网络,利用可学习的元提示和预定义的任务名称作为输入,生成每个任务的提示向量。
- 元网络通过 CLIP 的文本编码器处理元提示与任务名称的拼接输入,生成特定于任务的特征。
- 一个轻量级子网络将任务特征转换为连续的、软性的提示向量,实现可微分的参数共享。
- 元网络与元提示在所有目标少样本训练集的并集上联合微调,实现跨任务知识迁移。
- SoftCPT 采用类别无关的提示策略,即同一任务中的所有类别共享由元网络生成的同一提示向量。
- 该方法通过共享的可学习架构学习特定于任务的提示,避免硬性参数共享,从而提升适应性与性能。
实验结果
研究问题
- RQ1通过提示微调,多任务学习是否能提升视觉-语言模型在少样本图像识别中的性能?
- RQ2在任务之间实现提示参数的软性、连续共享,是否能带来比硬性共享或单任务微调更好的泛化性能?
- RQ3在性能与稳定性方面,所提出的 SoftCPT 方法与提示迁移和集成方法相比表现如何?
- RQ4在真实少样本场景中,提示特征所反映的任务相关性,在多大程度上与真实任务相关性一致?
- RQ5共享的元网络是否能有效生成高质量、特定于任务的提示,而无需微调视觉-语言模型的主要参数?
主要发现
- 在 16-shot 设置下,SoftCPT 在 General-10、Plant-6 和 Fashion-20 数据集上分别比 CoOp-CA 提高 0.73%、5.09% 和 0.93%。
- SoftCPT 在 General-10 上的 RSD(相对标准偏差)为 1.28%,在 Plant-6 上为 3.70%,表明其在跨任务上具有更优的性能稳定性。
- 与 CoOp-MT 相比,SoftCPT 在 General-10 上将 RSD 降低了 12.4%,证明其在多任务设置下具有更强的鲁棒性。
- SoftCPT-NATA 的相关性图与真实任务相似度的皮尔逊相关系数为 0.32,显著高于 CoOp-CA 的 -0.03,表明其与真实任务相关性对齐更优。
- 通过 Oracle 提示迁移和集成方法仅带来微小增益(例如 Plant-6 上约 0.07% 提升),而 SoftCPT 实现了显著增益,证明其优越性。
- SoftCPT-NATS 在 General-10 上达到 67.04% ± 0.23,在 Plant-6 上达到 67.13% ± 1.15,优于 CoOp-CA 和 Oracle 基线,在准确率与稳定性上均表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。