Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models

Juncheng Li, Minghe Gao|arXiv (Cornell University)|2023. 03. 12.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 유사한 이미지-텍스트 쌍만을 사용하여 최적의 소프트 프롬프트 초기화와 경량의 기울기 조절 함수를 동시에 학습하는 모델에 종속되지 않는 프레임워크인 Gradient-Regulated Meta-Prompt Learning (GRAM)을 제안한다. GRAM은 초기화 민감도를 줄이고 도메인 특화된 편향에 대한 과적합을 방지하여, 11개 데이터셋에서 일관되게 성능을 향상시키며, 텍스트 및 시각적 프롬프트 튜닝 간의 상호보완적 상호작용을 가능하게 하여 소수 샘플 일반화 능력을 향상시킨다.

ABSTRACT

Prompt tuning, a recently emerging paradigm, enables the powerful vision-language pre-training models to adapt to downstream tasks in a parameter -- and data -- efficient way, by learning the ``soft prompts'' to condition frozen pre-training models. Though effective, it is particularly problematic in the few-shot scenario, where prompt tuning performance is sensitive to the initialization and requires a time-consuming process to find a good initialization, thus restricting the fast adaptation ability of the pre-training models. In addition, prompt tuning could undermine the generalizability of the pre-training models, because the learnable prompt tokens are easy to overfit to the limited training samples. To address these issues, we introduce a novel Gradient-RegulAted Meta-prompt learning (GRAM) framework that jointly meta-learns an efficient soft prompt initialization for better adaptation and a lightweight gradient regulating function for strong cross-domain generalizability in a meta-learning paradigm using only the unlabeled image-text pre-training data. Rather than designing a specific prompt tuning method, our GRAM can be easily incorporated into various prompt tuning methods in a model-agnostic way, and comprehensive experiments show that GRAM brings about consistent improvement for them in several settings (i.e., few-shot learning, cross-domain generalization, cross-dataset generalization, etc.) over 11 datasets. Further, experiments show that GRAM enables the orthogonal methods of textual and visual prompt tuning to work in a mutually-enhanced way, offering better generalizability beyond the uni-modal prompt tuning methods.

연구 동기 및 목표

  • 소프트 프롬프트 초기화 방식에 따라 성능이 크게 달라지는 프롬프트 튜닝의 초기화 민감성 문제를 해결한다.
  • 제한된 훈련 데이터에서 임의의 상관관계에 과적합하는 소수 샘플 학습에서의 일반화 능력 저하 문제를 완화한다.
  • 최소한의 레이블 데이터로 고결된 비전-언어 모델을 새로운 작업에 신속하게 적응시킬 수 있도록 한다.
  • 텍스트 및 시각적 프롬프트 튜닝을 상호보완적이고 상호 강화되는 방식으로 향상시킬 수 있는 모델에 종속되지 않는 방법을 개발한다.
  • 감독된 메타학습 작업에 의존하지 않고, 대규모의 레이블이 없는 이미지-텍스트 데이터를 활용하여 메타학습을 수행한다.

제안 방법

  • 텍스트 및 이미지 콘텐츠를 기반으로 레이블이 없는 이미지-텍스트 데이터를 의미 주제와 서브-도메인으로 구조화하기 위해 교차 모달 계층적 클러스터링(CHC) 알고리즘을 제안한다.
  • 동일한 의미 주제 내에서 서로 다른 도메인에서 지원 및 쿼리 세트를 샘플링하여 메타학습 중 도메인 이동을 시뮬레이션하고, 다양한 소수 샘플 메타작업을 생성한다.
  • 쿼리 세트에서의 일반화 오차를 최소화하는 메타최적화 목표를 사용하여 소프트 프롬프트 초기화와 기울기 조절 함수를 동시에 메타학습한다.
  • 원시 미세조정 기울기를 다양한 도메인 간에 일관되고 도메인 일반화 가능한 방향으로 변환하는 경량의 기울기 조절 함수를 도입한다.
  • 메타학습 데이터로 인터넷에서 확보한 레이블이 없는 이미지-텍스트 쌍만을 사용하여, 애초에 애너테이션된 데이터셋에 의존하지 않는다.
  • 모델에 종속되지 않아 CoOp(텍스트 기반) 및 VPT(시각 기반)와 같은 다양한 프롬프트 튜닝 방법과 즉각 통합 가능하다.

실험 결과

연구 질문

  • RQ1레이블이 없는 이미지-텍스트 데이터에서 메타학습을 통해 소프트 프롬프트의 초기화를 개선하여 소수 샘플 적응에서 민감도를 낮출 수 있는가?
  • RQ2기울기 조절 함수는 프롬프트 튜닝 중 도메인 특화 패턴에 대한 과적합을 완화하고 도메인 간 일반화 능력을 향상시킬 수 있는가?
  • RQ3GRAM은 단일 방법이나 공동 튜닝보다 텍스트 및 시각적 프롬프트 튜닝 간의 상호작용을 더 효과적으로 향상시키는가?
  • RQ4감독된 메타학습 또는 레이블이 있는 데이터로의 사전학습에 비해, 레이블이 없는 데이터만을 사용했을 때 GRAM의 효과는 어떠한가?
  • RQ5프롬프트 토큰 수의 증가는 기본 클래스 성능과 새로운 클래스로의 일반화 능력 간의 균형에 어떤 영향을 미치는가?

주요 결과

  • GRAM은 다양한 무작위 초기화에 따른 성능 변동을 줄여 소프트 프롬프트 초기화에 대한 강건성을 입증한다.
  • 기울기 조절 함수는 학습 중 성능 저하를 방지하며, CoOp+GRAM은 새로운 클래스에서 높은 정확도를 유지하는 반면 CoOp만으로는 성능이 크게 떨어지는 것으로 나타났다.
  • GRAM은 베이스라인 대비 새로운 클래스에서 정확도를 15% 상대적으로 향상시키며, 이 개선의 주요 기여 요소는 기울기 조절 함수이다.
  • 레이블이 없는 데이터를 메타학습에 사용할 경우 WebVision과 같은 감독된 데이터셋을 사용하는 것보다 성능이 뛰어나며, 대규모이고 다양한 레이블이 없는 데이터가 메타학습에 더 효과적임을 시사한다.
  • GRAM을 통한 텍스트 및 시각적 프롬프트의 동시 메타학습은 상호 강화 효과를 만들어내어, 두 프롬프트 유형을 직접 공동 튜닝하는 것보다 뛰어난 성능을 달성한다.
  • 프롬프트 토큰 수를 4개를 초과해 늘일 경우 새로운 클래스에서의 일반화 성능이 떨어지며, 4개 토큰에서 기본 클래스와 새로운 클래스의 정확도 간 최적의 균형을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.