Skip to main content
QUICK REVIEW

[论文解读] ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free Domain Adaptation

Xuefeng Hu, Ke Zhang|arXiv (Cornell University)|Aug 4, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用 3
一句话总结

ReCLIP 提出了一种针对 CLIP 等视觉-语言模型的无源域自适应方法,通过学习一个投影空间来重新对齐视觉和文本嵌入,并利用标签传播生成高置信度伪标签。随后,通过跨模态自训练迭代优化两个编码器,将 22 个基准测试集上的零样本准确率从 69.83% 提升至 74.94%。

ABSTRACT

Large-scale Pre-Training Vision-Language Model such as CLIP has demonstrated outstanding performance in zero-shot classification, e.g. achieving 76.3% top-1 accuracy on ImageNet without seeing any example, which leads to potential benefits to many tasks that have no labeled data. However, while applying CLIP to a downstream target domain, the presence of visual and text domain gaps and cross-modality misalignment can greatly impact the model performance. To address such challenges, we propose ReCLIP, the first source-free domain adaptation method for vision-language models, which does not require any source data or target labeled data. ReCLIP first learns a projection space to mitigate the misaligned visual-text embeddings and learns pseudo labels, and then deploys cross-modality self-training with the pseudo labels, to update visual and text encoders, refine labels and reduce domain gaps and misalignments iteratively. With extensive experiments, we demonstrate ReCLIP reduces the average error rate of CLIP from 30.17% to 25.06% on 22 image classification benchmarks. Code available at https://github.com/michiganleon/ReCLIP_WACV.

研究动机与目标

  • 解决 CLIP 在下游目标域上因视觉-文本域差距和跨模态错位导致的性能下降问题。
  • 克服现有域自适应方法依赖标注目标数据或源数据的局限性。
  • 开发一种稳定且高效的无源域自适应框架,适用于视觉-语言模型,且无需访问源数据或目标标签。
  • 通过伪标签化与自训练联合优化视觉和文本编码器,提升零样本泛化能力。
  • 仅使用预训练的 CLIP 模型,在无标签目标数据上实现高效的一次性适应。

提出的方法

  • 学习一个投影空间,以去除视觉和文本嵌入中的冗余及与类别无关的特征,降低错位。
  • 在投影空间上使用标签传播,基于局部邻域结构生成准确的伪标签。
  • 应用基于高置信度伪标签的跨模态自训练,联合更新视觉和文本编码器。
  • 将训练过程解耦为两个并行分支:一个微调文本编码器而冻结视觉编码器,反之亦然。
  • 在两个分支之间共享伪标签,以稳定适应过程并提升一致性。
  • 在 CLIP 中使用多种模板增强的文本嵌入,以提升文本表征的多样性与鲁棒性。

实验结果

研究问题

  • RQ1我们能否在不访问源数据或标注目标数据的情况下,提升 CLIP 在下游域上的零样本性能?
  • RQ2投影空间在减少视觉-文本嵌入错位与域差距方面有多有效?
  • RQ3在投影空间上使用标签传播生成的伪标签是否比直接聚类或 k-NN 方法更可靠?
  • RQ4在无源设置下,通过共享伪标签的跨模态自训练能否稳定并提升适应性能?
  • RQ5ReCLIP 框架在不同视觉-语言模型与架构上的泛化能力如何?

主要发现

  • ReCLIP 将 CLIP 在 22 个图像分类基准测试上的平均 top-1 准确率从 69.83% 提升至 74.94%。
  • 该方法在细粒度数据集(如 Birdsnap 和 RESISC45)上取得显著提升,其中文本嵌入质量至关重要。
  • 在投影空间上使用标签传播(P₂)的策略带来最高提升,优于 k-NN 和聚类基线方法。
  • ReCLIP 展现出强大的泛化能力,在 SLIP、DeCLIP 以及多种 CLIP 变体上均实现性能提升,涵盖不同架构。
  • 适应过程高效,每个目标域仅需 0.5 至 5 GPU 小时(单张 V100 GPU)。
  • 消融实验证实,视觉与文本适应分支之间的伪标签共享显著提升了稳定性与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。