Skip to main content
QUICK REVIEW

[논문 리뷰] Self-regulating Prompts: Foundational Model Adaptation without Forgetting

Muhammad Uzair Khattak, Syed Talal Wasim|arXiv (Cornell University)|2023. 07. 13.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 CLIP와 같은 기본 시각-언어 모델에서 과적합을 방지하기 위해 작업별 및 작업에 관계없는 표현을 동시에 최적화하는 자기조절형 프롬프트 학습 프레임워크인 PromptSRC를 제안한다. 상호 동의, 고정된 CLIP 특징을 기반으로 한 가우시안 가중 자기 앙상블, 그리고 다수의 프롬프트 템플릿을 통한 텍스트 다양성 기반으로, 기존 MaPLe 대비 +1.42% 히르모닉 평균 향상과 CLIP 대비 +8.26% 향상을 달성하여 최신 기준 성능을 확보한다.

ABSTRACT

Prompt learning has emerged as an efficient alternative for fine-tuning foundational models, such as CLIP, for various downstream tasks. Conventionally trained using the task-specific objective, i.e., cross-entropy loss, prompts tend to overfit downstream data distributions and find it challenging to capture task-agnostic general features from the frozen CLIP. This leads to the loss of the model's original generalization capability. To address this issue, our work introduces a self-regularization framework for prompting called PromptSRC (Prompting with Self-regulating Constraints). PromptSRC guides the prompts to optimize for both task-specific and task-agnostic general representations using a three-pronged approach by: (a) regulating prompted representations via mutual agreement maximization with the frozen model, (b) regulating with self-ensemble of prompts over the training trajectory to encode their complementary strengths, and (c) regulating with textual diversity to mitigate sample diversity imbalance with the visual branch. To the best of our knowledge, this is the first regularization framework for prompt learning that avoids overfitting by jointly attending to pre-trained model features, the training trajectory during prompting, and the textual diversity. PromptSRC explicitly steers the prompts to learn a representation space that maximizes performance on downstream tasks without compromising CLIP generalization. We perform extensive experiments on 4 benchmarks where PromptSRC overall performs favorably well compared to the existing methods. Our code and pre-trained models are publicly available at: https://github.com/muzairkhattak/PromptSRC.

연구 동기 및 목표

  • CLIP와 같은 기초 시각-언어 모델에서 발생하는 프롬프트 과적합 문제를 해결하여 새로운 작업으로의 일반화 능력을 향상시키는 것.
  • 다운스트림 작업에 적응하면서도 원본의 제로샷 일반화 능력을 유지하는 것.
  • 작업별 적응과 작업에 관계없는 표현 학습을 균형 있게 조절하는 자기조절형 프롬프트 학습 프레임워크를 개발하는 것.
  • 특히 저자원 환경에서 시각 및 텍스트 모odal 간 데이터 불균형 문제를 완화하는 것.
  • 피팅 없이 도메인 시프트, 소수 샘플 학습, 크로스 데이터셋 전이 환경에서의 일반화 능력을 향상시키는 것.

제안 방법

  • 일반화 가능한 지식을 유지하기 위해 프롬프트된 특징과 고정된 CLIP 특징 간 상호 동의 최대화 손실을 도입한다.
  • 학습 에포크 동안의 프롬프트를 가우시안 가중치로 통합하는 프롬프트 집합 전략(GPA)을 적용하여 학습 안정성 향상과 상호 보완적 특성 활용을 도모한다.
  • 각 클래스별로 다양한 프롬프트 템플릿을 사용하여 텍스트 특징의 다양성을 증가시키고 텍스트 인코더 특징의 편향을 감소시킨다.
  • 시각적 및 텍스트적 프롬프트 표현 간 일치를 강제하기 위해 L1 거리 측정 기반의 특징 수준 일致성 손실(LSCL)을 적용한다.
  • 학습 중에 CLIP 텍스트 특징을 사전 계산하고, 시각적 특징은 단일 추가 순전파만으로도 처리하여 추론 효율성을 유지한다.
  • 세 가지 방향의 정규화 전략을 통합: 고정 모델과의 상호 동의, 학습 경로를 통한 자기 앙상블, 템플릿 증강을 통한 텍스트 다양성

실험 결과

연구 질문

  • RQ1고정된 CLIP 특징과의 상호 동의를 통한 자기조절이 다운스트림 성능을 희생시키지 않고 일반화 능력을 향상시킬 수 있는가?
  • RQ2학습 경로를 따라 프롬프트를 자기 앙상블링하면 프롬프트 학습의 강건성과 일반화 능력이 향상되는가?
  • RQ3다양한 프롬프트 템플릿을 통해 텍스트 다양성을 증가시키면 불균형 문제를 완화하고 표현 품질을 향상시킬 수 있는가?
  • RQ4PromptSRC는 도메인 시프트, 소수 샘플, 크로스 데이터셋 일반화 환경에서 어떻게 성능을 발휘하는가?
  • RQ5자기조절형 프롬프트 학습에서 성능 향상와 계산 비용 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 11개 데이터셋에 걸친 베이스-투-노블 일반화 벤치마크에서 PromptSRC는 히르모닉 평균 79.97%를 기록하여 MaPLe 대비 +1.42% 향상, CLIP 대비 +8.26% 향상하여 최신 기준 성능 달성.
  • 도메인 일반화 성능에서도 최신 기준 성능을 확보하였으며, 분포 외 데이터셋에서 평균 정확도 60.65%를 기록하여 이전 모든 방법을 초월한다.
  • 학습 비용은 낮게 유지되며, IVLP 대비 9.3% 더 오래 걸리고 GFLOPs는 0.13배 높을 뿐만 아니라, 추론 속도와 GFLOPs는 기준 방법과 동일하게 유지된다.
  • 제거 실험 결과, L1 매칭 손실이 코사인 유사도와 MSE보다 일致성 손실에서 뛰어난 성능을 보였고, 가우시안 가중 프롬프트 집합 전략이 등가 가중 평균보다 더 우수한 성능을 내는 것으로 나타났다.
  • 텍스트 템플릿 수를 늘일수록 성능 향상이 관찰되어, 텍스트 다양성이 초래하는 보다 강력한 감독과 표현 품질 향상을 입증한다.
  • 표현력과 일반화 능력의 균형을 고려할 때, 4개의 비전-언어 프롬프트와 4 토큰의 프롬프트 길이에서 최적의 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.