[论文解读] PromptStyler: Prompt-driven Style Generation for Source-free Domain Generalization
PromptStyler 提出了一种用于无源域泛化的提示驱动风格生成方法,通过可学习的风格词向量在联合视觉-语言空间中合成多样化的图像风格,且无需使用任何源域图像。通过在 CLIP 的潜在空间中最大化风格多样性并保持内容一致性,该方法在 PACS、VLCS、OfficeHome 和 DomainNet 基准上实现了最先进性能。
In a joint vision-language space, a text feature (e.g., from "a photo of a dog") could effectively represent its relevant image features (e.g., from dog photos). Also, a recent study has demonstrated the cross-modal transferability phenomenon of this joint space. From these observations, we propose PromptStyler which simulates various distribution shifts in the joint space by synthesizing diverse styles via prompts without using any images to deal with source-free domain generalization. The proposed method learns to generate a variety of style features (from "a S* style of a") via learnable style word vectors for pseudo-words S*. To ensure that learned styles do not distort content information, we force style-content features (from "a S* style of a [class]") to be located nearby their corresponding content features (from "[class]") in the joint vision-language space. After learning style word vectors, we train a linear classifier using synthesized style-content features. PromptStyler achieves the state of the art on PACS, VLCS, OfficeHome and DomainNet, even though it does not require any images for training.
研究动机与目标
- 解决在训练期间无法获取源域数据时的域泛化挑战。
- 在不访问真实图像的情况下,模拟预训练视觉-语言模型潜在空间中的多样化分布偏移。
- 通过可学习的风格词向量,在保持内容信息的同时生成多样且逼真的风格。
- 仅使用文本提示和预训练特征,在多个域泛化基准上实现最先进性能。
提出的方法
- 在联合视觉-语言空间中学习用于伪词 $\boldsymbol{S_{*}}$ 的风格词向量,通过类似 'a $\boldsymbol{S_{*}}$ style of a [class]' 的提示生成风格特征。
- 通过在超球面潜在空间中鼓励正交风格特征,使用 $\mathcal{L}_{\mathrm{style}}$ 最大化风格多样性。
- 通过确保风格-内容特征与其对应的内容特征保持接近,使用 $\mathcal{L}_{\mathrm{content}}$ 强制保持内容一致性。
- 使用内容提示中的类别标签在合成的风格-内容特征上训练线性分类器,通过图像编码器实现对真实图像的推理。
- 使用 CLIP 的预训练文本和图像编码器将提示和图像投影到共享嵌入空间。
- 通过同时优化风格多样性与内容一致性损失来更新风格词向量,实现在无真实数据情况下的有效域偏移模拟。

实验结果
研究问题
- RQ1我们能否在不使用任何源域图像的情况下,有效模拟预训练视觉-语言模型潜在空间中的域偏移?
- RQ2我们如何仅通过可学习的词向量和文本提示生成多样且保持内容一致的风格?
- RQ3提示驱动方法能否在无源域泛化任务中实现最先进性能?
- RQ4在零样本域自适应设置中,风格多样性和内容一致性对模型泛化能力有何影响?
主要发现
- PromptStyler 在 PACS(93.2%)、VLCS(82.3%)、OfficeHome(73.6%)和 DomainNet(49.5%)上实现了最先进准确率,且未使用任何源域图像。
- 该方法在所有基准上均大幅超越 CLIP,即使在未使用任何源数据的情况下,Terra Incognita 上的 top-1 准确率仍达 30.5%。
- 仅使用 5 个可学习风格词向量,PromptStyler 已超越 CLIP 性能,表明其具有极高的样本效率。
- 消融实验确认 $\mathcal{L}_{\mathrm{style}}$ 和 $\mathcal{L}_{\mathrm{content}}$ 均为必要:任一缺失均导致性能下降。
- 仅需 20 个风格词向量和每个向量 20 次训练迭代,即可实现最优性能,表明收敛速度快且计算成本低。
- 使用 ArcFace 损失进一步提升了准确率,优于标准 Softmax,证明了超球面嵌入优化的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。