Skip to main content
QUICK REVIEW

[论文解读] Learning to Prompt Your Domain for Vision-Language Models

Guoyizhe Wei, Feng Wang|arXiv (Cornell University)|Oct 4, 2023
Privacy-Preserving Technologies in DataComputer Science被引用 3
一句话总结

本文提出联邦双提示微调(Fed-DPT),一种领域感知的联邦学习方法,通过在预训练的CLIP模型中同时使用视觉和文本提示微调,适应客户端之间异构的数据。通过学习领域特定的提示并利用交叉注意力对齐视觉与文本表征,Fed-DPT在DomainNet上实现了68.4%的平均准确率——比原始CLIP高出14.8个百分点,展示了在去中心化、领域分布偏移场景下的强大鲁棒性与通信效率。

ABSTRACT

Prompt learning has recently become a very efficient transfer learning paradigm for Contrastive Language Image Pretraining (CLIP) models. Compared with fine-tuning the entire encoder, prompt learning can obtain highly competitive results by optimizing only a small number of parameters, which presents considerably exciting benefits for federated learning applications that prioritizes communication efficiency. However, in this work, we identify that directly transferring prompt learning approaches into federated learning does not yield favorable results since the model often suffers from considerable domain gaps across different clients. To address this issue, we propose ADAPT, a novel domain-aware prompt learning approach that facilitates both intra- and inter-domain prompts across federated participants. The basic idea of ADAPT is that the prompted CLIP should detect the input image's domain correspondence and before making the prediction of its category. Extensive experiments of ADAPT demonstrate its significant efficiency and effectiveness in federated learning. For example, by learning and sharing only 0.08M parameters, our ADAPT attains a 68.4% average accuracy over six domains in the DomainNet dataset, which improves the original CLIP by a large margin of 14.8%.

研究动机与目标

  • 为解决联邦学习中客户端数据源自不同领域且具有不同视觉风格的领域偏移问题。
  • 在数据异构性超出基于标签的非独立同分布划分的去中心化训练中,提升泛化能力与鲁棒性。
  • 开发一种参数高效、通信友好的方法,在不微调主模型的前提下,保持在多样化领域中的性能。
  • 通过联邦平均保持全局模型一致性,实现基于领域学习的提示微调,从而实现领域感知的自适应。
  • 在多领域、去中心化的图像分类任务中,超越现有的联邦学习与基于CLIP的基线方法。

提出的方法

  • 该方法采用冻结的图像与文本编码器的预训练CLIP模型,通过可学习的视觉与文本提示适应客户端特定的领域。
  • 视觉提示按客户端(即领域)独立学习,而文本提示在客户端间共享,但通过基于动量的指数移动平均进行更新,以稳定训练过程。
  • 利用交叉注意力机制动态对齐视觉与文本表征,增强模态间的特征相关性。
  • 通过联邦平均聚合各客户端在每个领域中的视觉提示参数,既保留领域特定的适应能力,又实现全局收敛。
  • 采用双提示微调策略:分别针对视觉输入(图像块)和文本输入(类别描述)进行优化,两者在联邦设置中端到端联合训练。
  • 通过仅传输提示参数优化通信开销,最小化带宽占用并保护隐私。

实验结果

研究问题

  • RQ1当客户端数据源自不同视觉领域时,使用CLIP的双提示微调是否能提升联邦学习中的泛化能力?
  • RQ2与领域无关的提示微调相比,领域特定的提示学习在处理跨领域分布偏移时表现如何?
  • RQ3基于动量的文本提示更新对联邦设置中模型稳定性与收敛性有何影响?
  • RQ4文本提示长度对领域感知联邦学习中的性能与泛化能力有何影响?
  • RQ5当数据异构性超出基于标签的非独立同分布划分(如细粒度客户端划分)时,Fed-DPT在性能保持方面表现如何?

主要发现

  • Fed-DPT在DomainNet数据集六个领域上的平均准确率达到68.4%,相比原始CLIP模型提升14.8个百分点。
  • 与FedAvg和FedProx相比,平均准确率分别高出16.8和16.0个百分点,证明其在数据异构性下具有更强的鲁棒性。
  • 若移除文本提示的动量更新,准确率下降2.2%,证实稳定、渐进式更新在联邦优化中的重要性。
  • 若统一在所有领域中训练所有文本提示令牌(即禁用领域特异性),准确率下降4.4%,验证了领域感知微调的必要性。
  • 最优文本提示长度为16个标记;更短的提示(4个)表现欠佳,更长的提示(32个)则导致过拟合与准确率下降。
  • 每轮通信频率为每轮一个训练周期时性能最优;降低至每轮0.5个周期无提升效果,而提高至每轮2个周期则导致准确率下降0.5%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。