Skip to main content
QUICK REVIEW

[논문 리뷰] Text-driven Prompt Generation for Vision-Language Models in Federated Learning

Qiu Chen, Xingyu Li|arXiv (Cornell University)|2023. 10. 09.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 연합 학습에서 여러 클라이언트 간에 통합된 맥락 인식 펌프 생성기를 훈련시켜 시각-언어 모델의 일반화 능력을 향상시키는 새로운 방법인 연합 텍스트 기반 프롬프트 생성(FedTPG)을 제안한다. 작업별 텍스트 입력에 따라 프롬프트 생성을 조건화함으로써 FedTPG는 FedCoOp 대비 미사용 클래스에서 4.32% 높은 정확도와 미사용 데이터셋에서 1.82% 높은 정확도를 달성하여 재학습 없이도 뛰어난 제로샷 일반화 성능을 보여준다.

ABSTRACT

Prompt learning for vision-language models, e.g., CoOp, has shown great success in adapting CLIP to different downstream tasks, making it a promising solution for federated learning due to computational reasons. Existing prompt learning techniques replace hand-crafted text prompts with learned vectors that offer improvements on seen classes, but struggle to generalize to unseen classes. Our work addresses this challenge by proposing Federated Text-driven Prompt Generation (FedTPG), which learns a unified prompt generation network across multiple remote clients in a scalable manner. The prompt generation network is conditioned on task-related text input, thus is context-aware, making it suitable to generalize for both seen and unseen classes. Our comprehensive empirical evaluations on nine diverse image classification datasets show that our method is superior to existing federated prompt learning methods, that achieve overall better generalization on both seen and unseen classes and is also generalizable to unseen datasets.

연구 동기 및 목표

  • 기존 연합 프롬프트 학습 방법이 시각-언어 모델에서 미사용 클래스와 작업에 대해 일반화 능력이 떨어지는 문제를 해결하기 위해.
  • CLIP과 같은 시각-언어 모델이 연합 환경에서 다양한 미사용 이미지 분류 데이터셋으로 효과적으로 일반화되도록 하기 위해.
  • 원격 클라이언트 간에 원시 데이터를 공유하지 않고도 통합된 프롬프트 생성기를 학습할 수 있는 확장성 있고 협업 가능한 방법을 개발하기 위해.
  • 고정된 프롬프트 벡터를 학습하는 대신 의미론적 작업 설명에 따라 생성된 프롬프트를 조건화함으로써 프롬프트 학습을 향상시키기 위해.
  • 기존 도메인에 대한 볼 수 있는 클래스와 볼 수 없는 클래스 모두에서 더 나은 성능을 달성하고, 새로운 도메인으로의 제로샷 전이를 가능하게 하기 위해.

제안 방법

  • 작업 관련 텍스트 입력(예: 클래스 이름 또는 설명)을 시각-언어 모델 CLIP의 맥락 인식 프롬프트 벡터로 변환하는 텍스트 기반 프롬프트 생성기(TPG)를 훈련한다.
  • 각 클라이언트가 다른 이미지 분류 데이터셋을 보유한 상태에서, 로컬 데이터와 모델 업데이트만을 사용하여 여러 클라이언트 간에 연합 방식으로 프롬프트 생성기를 훈련한다.
  • 각 클라이언트는 소수의 이미지-텍스트 쌍을 사용해 로컬로 프롬프트 생성기를 최적화한 후, 모델 가중치를 중앙 서버에 통신하여 집계한다.
  • 글로벌 프롬프트 생성기는 의미론적 텍스트 입력을 작업별 프롬프트 벡터로 매핑하는 데 학습하여 다양한 도메인과 맥락 간의 일반화를 가능하게 한다.
  • 텍스트 임베딩에 조건화된 프롬프트 벡터를 생성하기 위해 경량 신경망을 사용하며, 효율성을 위해 CLIP의 고정된 백본을 유지한다.
  • 데이터 및 통신 제약 조건이 있는 연합 환경에서 효과적으로 CLIP를 적응시키기 위해 대비 학습과 프롬프트 튜닝을 활용한다.

실험 결과

연구 질문

  • RQ1연합 프롬프트 생성 방법이 시각-언어 모델에서 미사용 클래스에 대해 고정된 프롬프트 학습보다 더 나은 일반화 성능을 보일 수 있는가?
  • RQ2작업별 텍스트에 따라 프롬프트 생성을 조건화하면 다양한 이미지 분류 데이터셋 간의 제로샷 일반화 능력이 어떻게 향상되는가?
  • RQ3여러 클라이언트 간에 통합되고 협업하는 프롬프트 생성기가 기존의 연합 프롬프트 학습 기준선보다 일반화 능력과 강건성 측면에서 뛰어나게 되는가?
  • RQ4제안된 방법은 클라이언트 데이터 분포, 샘플 수, 클라이언트 참여 비율의 변화에 얼마나 민감한가?
  • RQ5프롬프트 생성기는 객체 인식, 텍스처 분류와 같은 다양한 도메인 간에 텍스트 맥락에서 효과적인 프롬프트 벡터로의 일반화 가능한 함수를 학습할 수 있는가?

주요 결과

  • FedTPG는 9개 데이터셋 전반에서 FedCoOp 대비 평균 4.32% 향상된 성능을 보이며, 강력한 제로샷 일반화 능력을 입증한다.
  • 미사용 데이터셋에서 FedTPG는 FedCoOp 대비 평균 1.82% 높은 성능을 보이며, 새로운 도메인으로의 강건한 전이 능력을 보여준다.
  • 클라이언트 데이터 분포의 변화에 관계없이 일관된 성능을 유지하며, 클라이언트 클래스 수가 5에서 20으로 증가함에 따라 조화 평균 정확도가 73.07%에서 74.83%로 상승한다.
  • 클래스당 샘플 수가 1개를 초과할수록 FedTPG가 FedKgCoOp를 능가하는 성능 향상을 보이며, 더 나은 성능을 유지한다.
  • 클라이언트 참여 비율이 10%에서 100%로 변화하는 동안에도 모델은 강건성을 유지하며, 항상 FedCoOp와 FedKgCoOp를 능가한다.
  • 시각화 결과는 ImageNet에서 생성된 프롬프트 벡터가 다른 데이터셋으로도 잘 일반화됨을 확인하였으며, 서로 다른 도메인 간에 클러스터가 잘 정렬되어 있어 강력한 데이터셋 간 전이 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.