Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Domain Invariant Prompt for Vision-Language Models

Cairong Zhao, Yubin Wang|arXiv (Cornell University)|2022. 12. 08.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 CLIP와 같은 시각-언어 모델을 위한 도메인 불변 프롬프트를 생성하는 메타러닝 기반의 프롬프트 튜닝 방법인 MetaPrompt을 제안한다. 이는 미사전 처리된 도메인으로의 강력한 일반화를 가능하게 한다. 이중 모odal 프롬프트 네트워크와 비대칭 대비 손실, 에피소드 기반 훈련을 통해 MetaPrompt는 11개의 베이스-투-뉴 일반화 및 4개의 도메인 일반화 벤치마크에서 최신 기술(SOTA) 성능을 달성하며, 기존 방법들을 크게 능가한다.

ABSTRACT

Prompt learning is one of the most effective and trending ways to adapt powerful vision-language foundation models like CLIP to downstream datasets by tuning learnable prompt vectors with very few samples. However, although prompt learning achieves excellent performance over in-domain data, it still faces the major challenge of generalizing to unseen classes and domains. Some existing prompt learning methods tackle this issue by adaptively generating different prompts for different tokens or domains but neglecting the ability of learned prompts to generalize to unseen domains. In this paper, we propose a novel prompt learning paradigm that directly generates \emph{domain invariant} prompt that can be generalized to unseen domains, called MetaPrompt. Specifically, a dual-modality prompt tuning network is proposed to generate prompts for input from both image and text modalities. With a novel asymmetric contrastive loss, the representation from the original pre-trained vision-language model acts as supervision to enhance the generalization ability of the learned prompt. More importantly, we propose a meta-learning-based prompt tuning algorithm that explicitly constrains the task-specific prompt tuned for one domain or class to also achieve good performance in another domain or class. Extensive experiments on 11 datasets for base-to-new generalization and 4 datasets for domain generalization demonstrate that our method consistently and significantly outperforms existing methods.

연구 동기 및 목표

  • 미사전 처리된 도메인과 클래스로의 프롬프트 튜닝된 시각-언어 모델의 열악한 일반화 문제를 해결하기 위해.
  • 기존 프롬프트 학습 방법이 도메인 외 데이터로의 일반화를 명시적으로 강제하지 못하는 한계를 극복하기 위해.
  • 도메인 이동에 대해 불변인 프롬프트를 생성하면서도 내부 도메인 데이터에서의 성능를 유지하는 프롬프트 튜닝 패러다임을 개발하기 위해.
  • 메타러닝과 에피소드 기반 훈련을 활용하여 소수의 샘플 설정에서의 일반화 보장을 향상시키기 위해.
  • 이중 모달리티 프롬프트 네트워크를 설계하여 이미지 및 텍스트 프롬프트 벡터를 함께 학습하고, 더 높은 불변성을 확보하기 위해.

제안 방법

  • 이미지 및 텍스트 입력을 위한 별도의 연속 프롬프트 벡터를 학습하는 이중 모달리티 프롬프트 튜닝 네트워크를 제안한다.
  • 사전 훈련된 모델의 표현을 지도로 사용하여 프롬프트 일반화를 향상시키는 비대칭 대비 손실을 도입한다.
  • 각 에피소드에서 프롬프트 튜닝을 위해 도메인 또는 클래스의 부분 집합을 샘플링하는 배치 기반 에피소드 훈련 전략을 적용한다.
  • 메타러닝을 활용하여 한 도메인에서의 성능가 다른 알려지지 않은 도메인으로의 일반화가 잘 되도록 프롬프트를 최적화한다.
  • 이론적 분석을 통해 [43] 기반으로 에피소드 기반 프롬프트 튜닝의 일반화 경계가 O(1/√N)임을 정당화한다.
  • 깊이 영향을 연구하기 위해 시각-언어 모델의 여러 레이어(2–12)에 걸쳐 프롬프트 튜닝을 구현한다.

실험 결과

연구 질문

  • RQ1메타러닝 기반 프롬프트 튜닝은 시각-언어 모델에서 알려지지 않은 도메인과 클래스로의 일반화를 향상시킬 수 있는가?
  • RQ2기본적인 미세조정과 비교해 본다면, 제안된 에피소드 기반 훈련 전략은 프롬프트 일반화에 어떤 영향을 미치는가?
  • RQ3도메인 불변 프롬프트 성능을 달성하기 위한 최적의 프롬프트 길이와 레이어 구성은 무엇인가?
  • RQ4비대칭 대비 손실을 갖춘 이중 모달리티 프롬프트 네트워크는 단일 모달리티 또는 대칭적 접근 방식보다 일반화 성능을 향상시키는가?
  • RQ5제로샷 및 소수 샘플 일반화 설정에서 MetaPrompt는 입력 조건 기반 프롬프트 학습 방법과 비교해 어떻게 성능를 낼 수 있는가?

주요 결과

  • MetaPrompt는 11개의 베이스-투-뉴 일반화 데이터셋에서 최신 기술 성능을 달성하였으며, 12층 프롬프트 구성에서 기존 클래스에 대해 83.65%의 정확도, 새로운 클래스에 대해 75.48%의 정확도를 기록하였다.
  • 4개의 도메인 일반화 데이터셋에서 MetaPrompt는 10층과 8개의 프롬프트 벡터를 사용하여 평균 정확도 81.20%를 기록하였으며, 이는 이전 방법들을 능가하는 성능이다.
  • 에피소드 기반 훈련 전략은 FGVCAircraft(베이스-투-뉴)와 VLCS(도메인 일반화)에서 각각 3% 이상의 성능 향상을 보이며, 분포 이동에 대한 강력한 내구성을 입증하였다.
  • 제거 실험 결과, 각 모달리티에 대해 2개의 프롬프트 벡터가 기존 클래스와 새로운 클래스 성능 간의 최적 균형을 이룹니다. 반면, 도메인 일반화에서는 4개의 벡터가 최적임을 확인하였다.
  • 12개의 모든 레이어에 걸쳐 프롬프트 튜닝을 수행한 결과 전체 성능가 가장 우수하였으며, 두 일반화 설정 모두에서 깊이가 증가할수록 정확도가 점진적으로 향상됨을 확인하였다.
  • 비대칭 대비 손실은 사전 훈련된 모델의 표현을 지도로 활용하여 일반화 성능를 크게 향상시키며, 내부 도메인 데이터에 대한 과적합을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.