[论文解读] Domain Adaptation via Prompt Learning
本文提出了一种名为通过提示学习进行域适应(DAPL)的新方法,这是一种新颖的无监督域适应方法,通过仅优化少量可学习的提示标记来利用预训练的视觉-语言模型。与对齐源域和目标域特征的传统方法不同,DAPL利用特定于域的提示上下文和与域无关的提示上下文,以保持语义结构并提高分类准确率,在Office-Home和VisDA-2017数据集上分别取得了74.5%和86.9%的最先进性能。
Unsupervised domain adaption (UDA) aims to adapt models learned from a well-annotated source domain to a target domain, where only unlabeled samples are given. Current UDA approaches learn domain-invariant features by aligning source and target feature spaces. Such alignments are imposed by constraints such as statistical discrepancy minimization or adversarial training. However, these constraints could lead to the distortion of semantic feature structures and loss of class discriminability. In this paper, we introduce a novel prompt learning paradigm for UDA, named Domain Adaptation via Prompt Learning (DAPL). In contrast to prior works, our approach makes use of pre-trained vision-language models and optimizes only very few parameters. The main idea is to embed domain information into prompts, a form of representations generated from natural language, which is then used to perform classification. This domain information is shared only by images from the same domain, thereby dynamically adapting the classifier according to each domain. By adopting this paradigm, we show that our model not only outperforms previous methods on several cross-domain benchmarks but also is very efficient to train and easy to implement.
研究动机与目标
- 为解决传统无监督域适应(UDA)方法因强制域对齐而导致语义特征结构失真的局限性。
- 通过在特征表示中解耦语义信息与域信息,保持类别可分性。
- 提出一种提示学习框架,避免对抗性或统计域对齐,转而使用连续提示微调。
- 在预训练视觉-语言模型上仅进行极少的参数更新,实现高性能。
提出的方法
- DAPL设计了一种包含三个部分的提示:共享的与域无关的上下文、特定于域的上下文以及类别标签标记。
- 特定于域的上下文按每个域独立学习,使分类器能够动态适应每个域的独特分布。
- 对比学习目标在图像和文本表示匹配时进行对齐,同时将不匹配的样本对分开。
- 该方法采用CLIP作为骨干网络,仅微调提示嵌入,从而实现参数高效。
- 通过一种对比损失联合优化与域无关及特定于域的提示,该损失鼓励匹配的域-类别对之间对齐。
- 在训练过程中使用置信度阈值进行伪标签生成,以提高模型鲁棒性。
实验结果
研究问题
- RQ1提示学习能否有效应用于无监督域适应,以避免因域对齐导致的特征空间失真?
- RQ2引入特定于域的提示上下文是否能在不依赖域不变特征学习的情况下提升泛化能力?
- RQ3通过提示实现语义信息与域信息的解耦,对类别可分性和模型准确率有何影响?
- RQ4所提出方法在标准UDA基准上相较于强基线模型(如CLIP)的性能优势有多大?
主要发现
- DAPL在Office-Home数据集上实现了74.5%的top-1准确率,达到最先进性能,比强基线CLIP高出2.5个百分点。
- 在VisDA-2017基准上,DAPL达到86.9%的准确率,比CLIP基线高出2.5个百分点。
- 消融研究证实,特定于域的上下文至关重要,相比仅使用与域无关的上下文,性能提升了1.4%。
- 该方法对超参数选择具有鲁棒性,在不同伪标签阈值(τ从0.4到0.7)下性能下降极小。
- 在不同提示长度组合下性能保持稳定,表明仅需少量标记即可学习到有效的连续表示。
- 可视化结果表明,可学习提示在模糊或复杂图像上产生的预测比手工设计提示更自信且更准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。