Skip to main content
QUICK REVIEW

[論文レビュー] Unleashing the Power of Visual Prompting At the Pixel Level

Junyang Wu, Xianhang Li|arXiv (Cornell University)|Dec 20, 2022
Domain Adaptation and Few-Shot Learning被引用数 13
ひとこと要約

本稿では、エッジを保ったまま元の特徴を維持するため、入力画像を縮小してそれらを独立して変形するピクセルレベルの視覚的プロンプト手法「Enhanced Visual Prompting (EVP)」を提案する。勾配正規化や入力多様性といった adversarial training テクニックを統合することで、CLIP を用いて12のベンチマークで平均82.5%の精度を達成。これは先行研究より+5.2%、線形プローブより+2.2%上回る。

ABSTRACT

This paper presents a simple and effective visual prompting method for adapting pre-trained models to downstream recognition tasks. Our method includes two key designs. First, rather than directly adding together the prompt and the image, we treat the prompt as an extra and independent learnable component. We show that the strategy of reconciling the prompt and the image matters, and find that warping the prompt around a properly shrinked image empirically works the best. Second, we re-introduce two "old tricks" commonly used in building transferable adversarial examples, i.e., input diversity and gradient normalization, into visual prompting. These techniques improve optimization and enable the prompt to generalize better. We provide extensive experimental results to demonstrate the effectiveness of our method. Using a CLIP model, our prompting method sets a new record of 82.8% average accuracy across 12 popular classification datasets, substantially surpassing the prior art by +5.6%. It is worth noting that this prompting performance already outperforms linear probing by +2.1% and can even match fully fine-tuning in certain datasets. In addition, our prompting method shows competitive performance across different data scales and against distribution shifts. The code is publicly available at https://github.com/UCSC-VLAA/EVP.

研究の動機と目的

  • 事前学習済み視覚モデルの適応において、視覚的プロンプトと線形プローブの性能差を是正すること。
  • 元の画像情報の保持によって、ピクセルレベルの視覚的プロンプトの一般化性と最適化を向上させること。
  • adversarial training テクニックが視覚的プロンプト性能を向上させられるかを調査すること。
  • 下流の視覚タスクにおける完全なファインチューニングや線形プローブの代替手段として、パラメータ効率的かつ効果的な手法を開発すること。

提案手法

  • 視覚的プロンプトを入力画像に直接追加するのではなく、別個の学習可能なコンponentとして扱う。
  • 元の画像を縮小し、学習可能なプロンプトをその周囲にパディングすることで、特徴の損傷を防ぎ、独立した最適化を可能にする。
  • 訓練の安定化と一般化の向上のため、全画像勾配のL2正規化(勾配正規化)を適用する。
  • データ拡張(例:ランダムな水平反転)による入力多様性を導入し、耐性と最適化を向上させる。
  • 空間的認識力を向上させ、性能を改善するため、学習可能なトークンに位置埋め込みを適用する。
  • バックボーンを凍結したまま、標準的な誤差逆伝播によるエンドツーエンドのプロンプト最適化を実施する。

実験結果

リサーチクエスチョン

  • RQ1ピクセルレベルの視覚的プロンプトは、下流の視覚タスクにおいて線形プローブを上回ることができるか?
  • RQ2プロンプトと画像の相互作用設計が性能と特徴の保持に与える影響は何か?
  • RQ3勾配正規化や入力多様性といった adversarial training テクニックが、視覚的プロンプトの一般化を向上させられるか?
  • RQ4データ不足や分布シフトの下で、この手法はどのように性能を示すか?
  • RQ5ピクセルレベルのプロンプトは、完全なファインチューニングを上回るか、同等の性能を発揮できるか?

主な発見

  • EVP は CLIP-Base を用いて12の標準的な視覚ベンチマークで平均82.5%のトップ1精度を達成。これは先行するSOTAの視覚的プロンプト手法(VPT)を+5.2%上回る。
  • 線形プローブ(80.3% 対 82.5%)を+2.2%上回り、視覚的プロンプトが単純な特徴レベルの適応よりも効果的であることを示している。
  • いくつかのデータセットでは、完全にファインチューニングされた性能と同等か、それを上回っている。これは強力な表現能力を示している。
  • 入力多様性(例:RandomHorizontalFlip)は性能を0.7%向上させるが、RandAug や CutMix といったより強い拡張では性能が0.8–1.1%低下する。
  • 全画像勾配(L2-whole)を用いた勾配正規化では、CIFAR100で81.2%の精度を達成。部分的勾配正規化(79.4%)を上回る。
  • 学習可能なトークンに位置埋め込みを追加すると性能が著しく向上し、V P1T では平均84.8%の精度を達成(VPT比+2.4%)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。