[论文解读] Domain Prompt Learning for Efficiently Adapting CLIP to Unseen Domains
本文提出领域提示学习(DPL),一种通过在推理时训练轻量级MLP提示生成器来生成特定领域连续提示,从而高效适应未见领域的CLIP方法。DPL在无需微调视觉编码器的情况下,将CLIP在PACS、VLCS、OfficeHome和TerraIncognita等标准DG基准上的零样本准确率从73.7%提升至79.3%,实现了极低计算成本下的最先进性能。
Domain generalization (DG) is a difficult transfer learning problem aiming to learn a generalizable model for unseen domains. Recent foundation models (FMs) are robust to many distribution shifts and, therefore, should substantially improve the performance of DG. In this work, we study generic ways to adopt CLIP, a Visual-Language Foundation Model, for DG problems in image classification. While ERM greatly improves the accuracy with bigger backbones and training datasets using standard DG benchmarks, fine-tuning FMs is not practical in many real-world situations. We propose Domain Prompt Learning (DPL) as a novel approach for domain inference in the form of conditional prompt generation. DPL achieved a significant accuracy improvement with only training a lightweight prompt generator (a three-layer MLP), whose parameter is of equivalent scale to the classification projector in the previous DG literature. Combining \dplshort~with CLIP provides surprising performance, raising the accuracy of zero-shot CLIP from 73.7% to 79.3% on several standard datasets, namely PACS, VLCS, OfficeHome, and TerraIncognita. We hope the simplicity and success of our approach lead to broader adoption and analysis of foundation models in the domain generalization field. Our code is available at https://github.com/shogi880/DPLCLIP.
研究动机与目标
- 通过利用CLIP对分布偏移的鲁棒性,且在不微调视觉编码器的情况下,解决图像分类中的领域泛化(DG)问题。
- 克服标准微调的局限性,后者可能在某些领域上降低性能且计算成本高昂。
- 开发一种轻量级、高效的适应方法,在保留预训练特征的同时提升对未见领域的零样本泛化能力。
- 探索提示学习作为基础模型在DG中微调的可行替代方案,重点关注参数更新极少的推理时适应。
- 证明基于提示的适应方法可在PACS、VLCS、OfficeHome和TerraIncognita等标准DG基准上超越标准微调和零样本CLIP。
提出的方法
- 提出领域提示学习(DPL),一种基于推理时的提示生成方法,使用在源领域上训练的轻量级三层MLP提示生成器。
- 提示生成器接收输入图像并输出基于输入分布的连续领域特定提示,随后将这些提示与特定类别的文本提示拼接。
- 推理过程中所有CLIP组件(包括图像编码器和文本编码器)均被冻结,以保留预训练特征并确保稳定性。
- 通过在源领域上使用对比学习端到端训练提示生成器,使图像特征与生成的领域提示对齐。
- 采用连续提示表示,支持基于梯度的优化,使模型能够学习领域不变但领域特定的提示模式。
- 采用条件提示生成策略,即对每个输入图像动态生成提示,实现在无需重训练的情况下适应未见领域。
实验结果
研究问题
- RQ1在不微调视觉编码器的情况下,提示学习能否有效适应CLIP到未见领域?
- RQ2DPL在多个标准DG基准上的性能与标准微调和零样本CLIP相比如何?
- RQ3在源领域上训练的轻量级提示生成器是否能在推理时良好泛化到未见目标领域?
- RQ4基于提示的适应能否稳定性能并缓解在某些DG设置中观察到的微调负面影响?
- RQ5DPL在PACS、VLCS、OfficeHome和TerraIncognita等基准上对零样本CLIP准确率的提升程度如何?
主要发现
- DPL在PACS、VLCS、OfficeHome和TerraIncognita基准上将零样本CLIP准确率从73.7%提升至79.3%,表现出显著的性能提升。
- 在VLCS数据集上,DPL使用CLIP ViT-B16达到84.3%的准确率,优于微调主干网络的标准ERM,表明微调可能在某些数据集上降低性能。
- 在OfficeHome和VLCS上,冻结主干的ERM(经验风险最小化)优于使用微调主干的标准ERM,表明微调并不总是能提升泛化能力。
- DPL在所有评估数据集上均一致提升性能,表明其在适应未见领域时具有鲁棒性和稳定性。
- 尽管仅训练了一个小型MLP(三层,约10K参数),DPL的性能增益显著——在TerraIncognita上提升+6.1%,在VLCS上提升+3.7%。
- 消融研究证实,即使在ViT-B16等大模型主干上,DPL依然有效,且在多种领域偏移下具有良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。