Skip to main content
QUICK REVIEW

[논문 리뷰] Unleashing the Power of Visual Prompting At the Pixel Level

Junyang Wu, Xianhang Li|arXiv (Cornell University)|2022. 12. 20.
Domain Adaptation and Few-Shot Learning인용 수 13
한 줄 요약

이 논문은 사전 훈련된 비전 모델을 미세조정하는 데 있어 기존의 선형 프로빙보다 성능을 뛰어넘는 새로운 픽셀 수준의 시각적 프롬프팅 기법인 강화된 시각적 프롬프팅(EVP)을 제안한다. 이 방법은 입력 이미지를 축소하고 프롬프트를 독립적으로 왜곡하여 원래의 특징을 유지한다. 경쟁적 훈련 기법인 기울기 정규화와 입력 다양성 기법을 통합함으로써 CLIP를 사용하여 12개의 벤치마크에서 평균 82.5%의 정확도를 달성한다. 이는 기존 최고 성능 기법보다 +5.2% 높고, 선형 프로빙보다 +2.2% 높은 성능이다.

ABSTRACT

This paper presents a simple and effective visual prompting method for adapting pre-trained models to downstream recognition tasks. Our method includes two key designs. First, rather than directly adding together the prompt and the image, we treat the prompt as an extra and independent learnable component. We show that the strategy of reconciling the prompt and the image matters, and find that warping the prompt around a properly shrinked image empirically works the best. Second, we re-introduce two "old tricks" commonly used in building transferable adversarial examples, i.e., input diversity and gradient normalization, into visual prompting. These techniques improve optimization and enable the prompt to generalize better. We provide extensive experimental results to demonstrate the effectiveness of our method. Using a CLIP model, our prompting method sets a new record of 82.8% average accuracy across 12 popular classification datasets, substantially surpassing the prior art by +5.6%. It is worth noting that this prompting performance already outperforms linear probing by +2.1% and can even match fully fine-tuning in certain datasets. In addition, our prompting method shows competitive performance across different data scales and against distribution shifts. The code is publicly available at https://github.com/UCSC-VLAA/EVP.

연구 동기 및 목표

  • 사전 훈련된 비전 모델을 미세조정할 때 시각적 프롬프팅과 선형 프로빙 간의 성능 격차를 해소하기 위해.
  • 원본 이미지 정보를 유지함으로써 픽셀 수준의 시각적 프롬프팅의 일반화 및 최적화를 향상시키기 위해.
  • 경쟁적 훈련 기법이 시각적 프롬프팅 성능 향상에 기여할 수 있는지 조사하기 위해.
  • 하류 비전 작업을 위한 완전한 미세조정과 선형 프로빙의 효율적이고 파rameter 효율적인 대안을 개발하기 위해.

제안 방법

  • 시각적 프롬프트를 입력 이미지에 직접 추가하는 대신, 별도의 학습 가능한 구성요소로 간주하기 위해.
  • 원본 이미지를 축소하고 학습 가능한 프롬프트를 그 주변으로 패딩하여 특징 손상 방지 및 독립적 최적화 가능하게 하기 위해.
  • 훈련 안정성 향상과 일반화 성능 향상을 위해 전체 이미지 기울기의 L2 노름을 사용한 기울기 정규화를 적용하기 위해.
  • 데이터 증강(예: 무작위 수평 뒤집기)을 통해 입력 다양성을 도입하여 강건성과 최적화 성능 향상시키기 위해.
  • 공간 인식 능력 향상과 성능 향상을 위해 학습 가능한 토큰에 위치 임베딩을 적용하기 위해.
  • 백본은 동결한 채로 표준 역전파를 통해 프롬프트를 종합적으로 최적화하기 위해.

실험 결과

연구 질문

  • RQ1픽셀 수준의 시각적 프롬프팅이 하류 비전 작업에서 선형 프로빙을 능가할 수 있는가?
  • RQ2프롬프트-이미지 상호작용 설계가 성능과 특징 유지에 어떤 영향을 미치는가?
  • RQ3기울기 정규화와 입력 다양성과 같은 경쟁적 훈련 기법이 시각적 프롬프팅의 일반화를 향상시킬 수 있는가?
  • RQ4자료 부족과 분포 이탈 상황에서 이 방법의 성능은 어떠한가?
  • RQ5픽셀 수준의 프롬프팅이 완전한 미세조정 성능을 따라하거나 능가할 수 있는가?

주요 결과

  • EVP는 CLIP-Base를 사용하여 12개의 표준 비전 벤치마크에서 평균 82.5%의 상위-1 정확도를 달성했으며, 이는 이전 최고 기술인 VPT보다 +5.2% 높은 성능이다.
  • 선형 프로빙보다 +2.2% 높은 성능(80.3% 대 82.5%)을 기록하여, 시각적 프롬프팅이 단순한 특징 수준의 적응보다 더 효과적일 수 있음을 입증한다.
  • 몇몇 데이터셋에서는 완전한 미세조정 성능과 동일하거나 이를 초월하는 성능을 기록하여 강력한 표현 능력을 보여준다.
  • 입력 다양성(예: RandomHorizontalFlip)은 성능을 0.7% 향상시키지만, RandAug나 CutMix와 같은 강력한 증강 기법은 결과를 0.8–1.1% 악화시킨다.
  • 전체 이미지 기울기의 L2 노름을 사용한 기울기 정규화(L2-whole)는 CIFAR100에서 81.2%의 정확도를 기록하여 부분 기울기 정규화보다 높은 성능(79.4%)을 보였다.
  • 학습 가능한 토큰에 위치 임베딩을 추가하면 성능이 크게 향상되며, V P1T는 평균 84.8%의 정확도를 기록하여 VPT 대비 +2.4% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.