[논문 리뷰] Learning to Prompt Your Domain for Vision-Language Models
이 논문은 이질적인 데이터를 가진 클라이언트 간에 적응하기 위해 사전 훈련된 CLIP 모델 내에서 시각적 및 텍스트 프롬프트 튜닝을 모두 사용하는 도메인 인식형 페더레이티드 러닝 방법인 페더레이티드 듀얼 프롬프트 튜닝(Fed-DPT)을 제안한다. 도메인별로 특화된 프롬프트를 학습하고, 시각적 및 텍스트적 표현을 정렬하기 위해 교차 어텐션을 활용함으로써, Fed-DPT는 도메인넷에서 평균 68.4%의 정확도를 달성하며, 원본 CLIP보다 14.8%포인트 높은 성능을 보이며, 분산된, 도메인 이동이 발생하는 환경에서 뛰어난 강건성과 통신 효율성을 입증한다.
Prompt learning has recently become a very efficient transfer learning paradigm for Contrastive Language Image Pretraining (CLIP) models. Compared with fine-tuning the entire encoder, prompt learning can obtain highly competitive results by optimizing only a small number of parameters, which presents considerably exciting benefits for federated learning applications that prioritizes communication efficiency. However, in this work, we identify that directly transferring prompt learning approaches into federated learning does not yield favorable results since the model often suffers from considerable domain gaps across different clients. To address this issue, we propose ADAPT, a novel domain-aware prompt learning approach that facilitates both intra- and inter-domain prompts across federated participants. The basic idea of ADAPT is that the prompted CLIP should detect the input image's domain correspondence and before making the prediction of its category. Extensive experiments of ADAPT demonstrate its significant efficiency and effectiveness in federated learning. For example, by learning and sharing only 0.08M parameters, our ADAPT attains a 68.4% average accuracy over six domains in the DomainNet dataset, which improves the original CLIP by a large margin of 14.8%.
연구 동기 및 목표
- 클라이언트의 데이터가 서로 다른 도메인에서 유래되며, 각각 다른 시각적 스타일을 가진 경우 발생하는 도메인 이동 문제를 해결하기 위해.
- 라벨 기반의 비i.i.d. 분할을 초월하여 데이터 이질성 하에서 일반화 및 강건성을 향상시키기 위해.
- 메인 모델의 미세조정 없이도 다양한 도메인에서 성능을 유지할 수 있는 파라미터 효율적이고 통신 우수한 방법을 개발하기 위해.
- 페더럴 평균을 통해 전역 모델 일관성을 유지하면서도, 도메인별로 별도의 프롬프트를 학습하여 도메인 인식형 적응을 가능하게 하기 위해.
- 다중 도메인, 분산된 이미지 분류 환경에서 기존의 페더레이티드 러닝 및 CLIP 기반 베이스라인을 능가하기 위해.
제안 방법
- 고정된 이미지 및 텍스트 인코더를 갖춘 사전 훈련된 CLIP 모델을 사용하며, 클라이언트 전용 도메인에 맞게 학습 가능한 시각적 및 텍스트적 프롬프트를 적용한다.
- 시각적 프롬프트는 클라이언트(도메인)별로 학습되지만, 텍스트 프롬프트는 클라이언트 간에 공유되며, 안정적인 훈련을 위해 동적 평균 기반 지수 이동 평균으로 업데이트된다.
- 교차 어텐션 기반 기법을 사용해 동적으로 시각적 및 텍스트적 표현을 정렬함으로써, 다중 모odal 간의 특징 상관관계를 향상시킨다.
- 페더럴 평균을 통해 도메인별 클라이언트 간의 시각적 프롬프트 파라미터를 집계함으로써, 도메인 특화된 적응을 유지하면서도 전역 수렴을 가능하게 한다.
- 이 방법은 이중 프롬프트 튜닝 전략을 사용한다: 하나는 시각적 입력(이미지 패치)을 위한 것이고, 다른 하나는 텍스트적 입력(클래스 설명)을 위한 것으로, 양방향으로 통합된 페더럴 환경에서 최적화된다.
- 통신 효율을 높이기 위해 프롬프트 파라미터만 전송함으로써 대역폭을 최소화하고 프라이버시를 보존한다.
실험 결과
연구 질문
- RQ1클라이언트의 데이터가 서로 다른 시각적 도메인에서 유래하는 경우, CLIP를 사용한 이중 프롬프트 튜닝이 페더레이티드 러닝에서 일반화를 향상시킬 수 있는가?
- RQ2도메인에 관계없이 적용되는 프롬프트 튜닝과 비교해, 도메인별로 특화된 프롬프트 학습은 교차 도메인 분포 이동을 다룰 때 어떤가?
- RQ3모멘타임 기반 텍스트 프롬프트 업데이트가 페더럴 환경에서 모델의 안정성과 수렴에 어떤 영향을 미치는가?
- RQ4텍스트 프롬프트의 길이가 도메인 인식형 페더럴 러닝에서 성능과 일반화에 어떤 영향을 미치는가?
- RQ5데이터 이질성이 라벨의 비i.i.d. 분할을 초월하여 세밀한 클라이언트 분할과 같은 상황에서 증가할 경우, Fed-DPT는 성능을 얼마나 잘 유지하는가?
주요 결과
- Fed-DPT는 도메인넷 데이터셋의 여섯 도메인에서 평균 68.4%의 정확도를 달성하였으며, 이는 원본 CLIP 모델 대비 14.8%포인트 향상된 성능이다.
- FedAvg와 FedProx보다 평균적으로 각각 16.8%, 16.0%포인트 높은 성능을 보이며, 데이터 이질성에 대한 강건성을 입증한다.
- 텍스트 프롬프트의 모멘타임 업데이트를 제거하면 정확도가 2.2% 감소하여, 페더럴 최적화에서 안정적이고 점진적인 업데이트의 중요성을 확인한다.
- 모든 도메인에서 텍스트 프롬프트 토큰을 동일하게 학습하는 것(즉, 도메인별 특화 기능 비활성화)은 정확도를 4.4% 감소시켜, 도메인 인식형 튜닝의 필요성을 입증한다.
- 최적의 텍스트 프롬프트 길이는 16 토큰이며, 짧은 프롬프트(4 토큰)는 성능이 열 劣하고, 긴 프롬프트(32 토큰)는 과적합을 유도하고 정확도를 감소시킨다.
- 1라운드당 1에포크의 통신 빈도가 최적의 성능을 낳는다. 0.5에포크로 감소시켜도 유의미한 이득이 없으며, 2에포크로 증가시킬 경우 정확도가 0.5% 감소한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.