Skip to main content
QUICK REVIEW

[论文解读] Text-driven Prompt Generation for Vision-Language Models in Federated Learning

Qiu Chen, Xingyu Li|arXiv (Cornell University)|Oct 9, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出联邦文本驱动提示生成(FedTPG),一种新颖的方法,在联邦学习中跨多个客户端训练统一的、上下文感知的提示生成器,以提升视觉-语言模型的泛化能力。通过基于特定任务的文本输入来条件化提示生成,FedTPG在未见类别上相比FedCoOp实现4.32%的准确率提升,在未见数据集上实现1.82%的提升,展示了无需微调的优越零样本泛化能力。

ABSTRACT

Prompt learning for vision-language models, e.g., CoOp, has shown great success in adapting CLIP to different downstream tasks, making it a promising solution for federated learning due to computational reasons. Existing prompt learning techniques replace hand-crafted text prompts with learned vectors that offer improvements on seen classes, but struggle to generalize to unseen classes. Our work addresses this challenge by proposing Federated Text-driven Prompt Generation (FedTPG), which learns a unified prompt generation network across multiple remote clients in a scalable manner. The prompt generation network is conditioned on task-related text input, thus is context-aware, making it suitable to generalize for both seen and unseen classes. Our comprehensive empirical evaluations on nine diverse image classification datasets show that our method is superior to existing federated prompt learning methods, that achieve overall better generalization on both seen and unseen classes and is also generalizable to unseen datasets.

研究动机与目标

  • 解决现有联邦提示学习方法在视觉-语言模型中对未见类别和任务泛化能力差的问题。
  • 使CLIP等视觉-语言模型能在联邦设置下有效泛化到多样化的未见图像分类数据集。
  • 开发一种可扩展的协作方法,在不共享原始数据的前提下,跨远程客户端学习统一的提示生成器。
  • 通过基于语义任务描述而非学习固定提示向量来改进提示学习。
  • 在已见和未见类别上均实现更好性能,包括向新领域进行零样本迁移。

提出的方法

  • 训练一个文本驱动的提示生成器(TPG),将与任务相关的文本输入(如类别名称或描述)转换为CLIP的上下文感知提示向量。
  • 在多个客户端之间以联邦方式训练提示生成器,每个客户端拥有不同的图像分类数据集,仅使用本地数据和模型更新。
  • 每个客户端使用少量样本的图像-文本对在本地优化提示生成器,然后将模型权重发送至中央服务器进行聚合。
  • 全局提示生成器学习将语义文本输入映射为特定任务的提示向量,从而实现在不同领域和上下文间的泛化。
  • 该方法使用轻量级神经网络生成基于文本嵌入的提示向量,同时保留CLIP的冻结主干网络以保证效率。
  • 该方法利用对比学习和提示微调,在数据和通信受限的联邦设置下有效适应CLIP。

实验结果

研究问题

  • RQ1联邦提示生成方法是否能在视觉-语言模型的未见类别上优于固定提示学习?
  • RQ2基于特定任务文本条件化提示生成,如何提升在多样化图像分类数据集上的零样本泛化能力?
  • RQ3在多个客户端上联合训练的统一协作提示生成器是否在泛化能力和鲁棒性方面优于现有联邦提示学习基线方法?
  • RQ4所提出方法对客户端数据分布差异、样本数(shot数)和客户端参与率的变化敏感度如何?
  • RQ5提示生成器能否学习到一个可泛化的函数,将文本上下文映射为跨对象识别和纹理分类等领域的有效提示向量?

主要发现

  • 在九个数据集上,FedTPG相比FedCoOp在未见类别上平均提升4.32%,证明了其强大的零样本泛化能力。
  • 在未见数据集上,FedTPG相比FedCoOp平均提升1.82%,显示出对新领域的强鲁棒性迁移能力。
  • 该方法在不同客户端数据分布下保持一致性能,随着客户端类别数从5增加到20,调和平均准确率从73.07%提升至74.83%。
  • 当每类样本数超过一个时,FedTPG性能优于FedKgCoOp,表明其在多 shot 设置下更具优势。
  • 在客户端参与率从10%到100%的范围内,模型保持鲁棒性,始终优于FedCoOp和FedKgCoOp。
  • 可视化结果表明,从ImageNet生成的提示向量能很好地泛化到其他数据集,不同领域间的聚类对齐良好,表明具有强大的跨数据集迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。