[論文レビュー] Explicit Visual Prompting for Universal Foreground Segmentations
本稿では、画像パッチ埋め込みと学習された高周波成分のタスク固有のチューニングにより、凍結されたビジョントランスフォーマーベースを適応させる統一的なフレームワークである明示的視覚プロンプティング(EVP)を提案する。これらの明示的視覚特徴を、わずかにチューナブルなパラメータでの再調整によって、14のデータセットにおける5つの前景セグメンテーションタスクで最先端の性能を達成し、フル微調整や他のパrameter効率の良い手法を上回る。
Foreground segmentation is a fundamental problem in computer vision, which includes salient object detection, forgery detection, defocus blur detection, shadow detection, and camouflage object detection. Previous works have typically relied on domain-specific solutions to address accuracy and robustness issues in those applications. In this paper, we present a unified framework for a number of foreground segmentation tasks without any task-specific designs. We take inspiration from the widely-used pre-training and then prompt tuning protocols in NLP and propose a new visual prompting model, named Explicit Visual Prompting (EVP). Different from the previous visual prompting which is typically a dataset-level implicit embedding, our key insight is to enforce the tunable parameters focusing on the explicit visual content from each individual image, i.e., the features from frozen patch embeddings and high-frequency components. Our method freezes a pre-trained model and then learns task-specific knowledge using a few extra parameters. Despite introducing only a small number of tunable parameters, EVP achieves superior performance than full fine-tuning and other parameter-efficient fine-tuning methods. Experiments in fourteen datasets across five tasks show the proposed method outperforms other task-specific methods while being considerably simple. The proposed method demonstrates the scalability in different architectures, pre-trained weights, and tasks. The code is available at: https://github.com/NiFangBaAGe/Explicit-Visual-Prompt.
研究の動機と目的
- 顕著なオブジェクト検出、改ざん検出、 camouflage オブジェクト検出などの多様な前景セグメンテーションタスクを統一的に扱うフレームワークの欠如に対処すること。
- タスク固有のアーキテクチャに依存することを減らし、1つのモデルが複数の前景セグメンテーションタスクに一般化可能になるようにすること。
- フル微調整ではなく、明示的視覚プロンプトを通じてタスク固有の知識を学習することにより、パrameter効率とモデル一般化性能を向上させること。
- 周波数ドメインにおける画像埋め込みと高周波成分から導出される明示的視覚プロンプトの有効性を検討すること。
提案手法
- 事前学習済みビジョントランスフォーマーベースを凍結し、下流タスクに適応するための少数のチューナブルパラメータを導入する。
- 周波数ドメインにおける適応的マスクを用いたフーリエMLPを介して、凍結されたパッチ埋め込みからの特徴と高周波成分を学習する。
- 周波数強化アダプタは、画像埋め込みと周波数特徴を可学習マッピングを通じて組み合わせ、すべてのトランスフォーマーブロックでタスク固有の適応を可能にする。
- スケール要因 $ r $ は、チューナブルパラメータの数を制御し、モデルの複雑さと性能のバランスをとる。
- プロンプトが入力画像特徴とそのスペクトル表現から直接学習されるため、エンドツーエンドでトレーニング可能である。
- さまざまなビジョントランスフォーマーアーキテクチャと事前学習済み重みと互換性があり、高いスケーラビリティを示している。
実験結果
リサーチクエスチョン
- RQ1タスク固有のアーキテクチャ設計を一切行わずに、多様な前景セグメンテーションタスクで最先端の性能を達成できる統一フレームワークは存在するか?
- RQ2画像パッチ埋め込みと高周波成分に基づく明示的視覚プロンプティングは、暗黙的プロンプティングやフル微調整に比べてどれほど効果的か?
- RQ3パrameterオーバーヘッドを最小限に抑えつつ性能を最大化するための、チューナブルパラメータと適応段階の最適な構成は何か?
- RQ4事前バージョンで使用された固定で手作業で作成されたマスクと比較して、周波数ドメインプロンプトをエンドツーエンドで学習することで性能が向上するか?
主な発見
- EVPは、5つの前景セグメンテーションタスクをカバーする14のデータセットにおいて、フル微調整や他のパrameter効率の良い微調整手法を上回る優れた性能を達成する。
- 画像埋め込みまたは周波数特徴のいずれかを除去すると、性能が著しく低下するため、両方のコンポonentが効果的なプロンプティングに不可欠であることが確認された。
- SegFormer-B4の4段階すべてをチューニングすると最良の性能が得られ、特に第3段階が最も寄与しており、上位層か下位層に偏りは観察されなかった。
- 最適なスケール要因 $ r = 16 $ は、性能とパrameter効率のバランスをとる。$ r $ を8や4にさらに減らしても一貫した向上は得られなかった。
- フーリエMLPを用いて周波数特徴を適応的に学習するEVPv2は、固定マスクを用いるEVPv1を上回る性能を示した。
- 本手法は、さまざまなビジョントランスフォーマーアーキテクチャと事前学習済み重みに対しても高いスケーラビリティを示し、最小限のトレーニング可能なパラメータで高い性能を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。