[论文解读] Domain-Unified Prompt Representations for Source-Free Domain Generalization
本文提出一种无需源域数据的源域无关域泛化方法,利用视觉-语言模型(CLIP)生成的领域统一提示表征,避免了训练过程中对源域数据的依赖。通过从大规模领域库中生成多样化的文本提示,并应用可学习适配器(CAE)将这些提示统一为领域不变表征,该方法在标准基准上达到最先进性能,并在无任何源数据的情况下显著优于现有方法在开放世界领域的表现。
Domain generalization (DG), aiming to make models work on unseen domains, is a surefire way toward general artificial intelligence. Limited by the scale and diversity of current DG datasets, it is difficult for existing methods to scale to diverse domains in open-world scenarios (e.g., science fiction and pixelate style). Therefore, the source-free domain generalization (SFDG) task is necessary and challenging. To address this issue, we propose an approach based on large-scale vision-language pretraining models (e.g., CLIP), which exploits the extensive domain information embedded in it. The proposed scheme generates diverse prompts from a domain bank that contains many more diverse domains than existing DG datasets. Furthermore, our method yields domain-unified representations from these prompts, thus being able to cope with samples from open-world domains. Extensive experiments on mainstream DG datasets, namely PACS, VLCS, OfficeHome, and DomainNet, show that the proposed method achieves competitive performance compared to state-of-the-art (SOTA) DG methods that require source domain data for training. Besides, we collect a small datasets consists of two domains to evaluate the open-world domain generalization ability of the proposed method. The source code and the dataset will be made publicly available at https://github.com/muse1998/Source-Free-Domain-Generalization
研究动机与目标
- 解决在缺乏源域数据的开放世界场景中领域泛化的问题。
- 减少对大规模源域图像数据的依赖,后者在实际应用中往往难以获取。
- 开发一种能有效泛化到未见领域(包括罕见或艺术化风格如马赛克或艺术风格)的方法。
- 利用视觉-语言模型中丰富的预存领域知识,实现零样本领域泛化。
提出的方法
- 构建一个包含来自多个现有数据集(PACS、VLCS、OfficeHome、DomainNet)的多样化文本提示的领域库,以表征广泛的领域。
- 使用CLIP将这些提示编码为文本嵌入,作为领域表征学习的基础。
- 引入一个可学习的交叉注意力编码器(CAE),以过滤掉领域特异性信息,同时保留类别特异性特征,生成领域统一的提示表征。
- 对CAE输出应用平均池化,为每个类别生成单一的、领域不变的表征用于分类。
- 仅使用目标域数据进行模型训练,将领域统一的提示表征作为类别原型。
- 在CAE训练过程中采用对比学习目标,以促进类别特定聚类和领域不变性。
实验结果
研究问题
- RQ1能否在不使用源域图像的情况下,仅从文本提示中有效学习到领域统一的提示表征?
- RQ2与需要源数据的SOTA方法相比,该方法在标准领域泛化基准上的表现如何?
- RQ3该方法在训练期间未见过的真正开放世界领域(如马赛克或几何风格)上的泛化能力如何?
- RQ4使用大规模、多样化的领域库是否能提升对分布外领域的鲁棒性?
- RQ5CAE模块在过滤领域特异性特征的同时,保留类别级语义信息方面的有效性如何?
主要发现
- 在PACS数据集上,该方法仅使用目标域数据即达到97.1%的准确率,优于多源SOTA方法DPL(照片类94.9%,素描类90.8%)。
- 在OfficeHome数据集上,该方法在开放世界马赛克和几何风格领域达到95.1%的准确率,显著超过ERM(51.5%)和GroupDRO(52.2%)基线。
- CAE模块成功地将来自不同领域的提示表征聚类到一个共享中心周围,t-SNE可视化结果表明其有效实现了领域不变性学习。
- 该方法在所有四个标准DG数据集(PACS、VLCS、OfficeHome、DomainNet)上均达到SOTA性能,在联合领域库设置下的平均准确率达到73.2%。
- 消融研究证实,扩大领域库可提升在开放世界领域上的性能,验证了更丰富、更多样化提示库的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。