Skip to main content
QUICK REVIEW

[論文レビュー] Explicit Visual Prompting for Low-Level Structure Segmentations

Weihuang Liu, Xi Shen|arXiv (Cornell University)|Mar 20, 2023
Image Processing Techniques and Applications被引用数 7
ひとこと要約

本論文は、改ざん、ボケ、影、 camouflageされた物体検出などの低レベル構造セグメンテーションタスクを統合的かつパラメータ効率的に処理するための Explicit Visual Prompting (EVP) を提案する。入力画像の固定されたパッチ埋め込みと高周波成分を調整することで、ベースライン手法に比べて僅かに5.7%多いトレーニング可能なパラメータで最先端の性能を達成し、プロンプトチューニングベースラインおよびタスク特化型モデルを上回る性能を発揮する。

ABSTRACT

We consider the generic problem of detecting low-level structures in images, which includes segmenting the manipulated parts, identifying out-of-focus pixels, separating shadow regions, and detecting concealed objects. Whereas each such topic has been typically addressed with a domain-specific solution, we show that a unified approach performs well across all of them. We take inspiration from the widely-used pre-training and then prompt tuning protocols in NLP and propose a new visual prompting model, named Explicit Visual Prompting (EVP). Different from the previous visual prompting which is typically a dataset-level implicit embedding, our key insight is to enforce the tunable parameters focusing on the explicit visual content from each individual image, i.e., the features from frozen patch embeddings and the input's high-frequency components. The proposed EVP significantly outperforms other parameter-efficient tuning protocols under the same amount of tunable parameters (5.7% extra trainable parameters of each task). EVP also achieves state-of-the-art performances on diverse low-level structure segmentation tasks compared to task-specific solutions. Our code is available at: https://github.com/NiFangBaAGe/Explicit-Visual-Prompt.

研究の動機と目的

  • 改ざん領域、ボケ、影、camouflageされた物体といった多様な低レベル画像構造の検出を、一つのフレームワークで統合すること。
  • 低レベルセグメンテーションタスクにおけるラベル付きデータの限界と大規模データセットの不足という課題に対処すること。
  • 自然言語処理のプロンプト技術をインspiredとして視覚分野に適応させたパラメータ効率的なチューニングを用いて、低レベル構造セグメンテーションの性能を向上させること。
  • タスク特化型の知識が、一般的な学習可能トークンではなく、画像固有の視覚的コンテンツを介して効果的にチューニング可能であることを示すこと。

提案手法

  • EVPは、入力画像の固定パッチ埋め込みと高周波成分の特徴をタスク特化型のプロンプトとして使用する視覚的プロンプティングメカニズムを導入する。
  • 学習可能なアダプタ(Adaptors)を適用して、固定されたビジョン Transformerバックボーンからの特徴を再調整し、効率的なファインチューニングを可能にする。
  • スケーリング要因 $ r $ がアダプタ内のトレーニング可能なパラメータ数を制御し、モデルサイズと性能のバランスを取る。
  • アダプタは、SegFormerバックボーンの特定の段階で特徴をチューニングする共有または非共有のMLPヘッドで構成される。
  • 本手法は汎用性を備えており、階層的(SegFormer)およびシンプルなViTバックボーンの両方でテストされている。
  • 高周波成分は単純なフィルタ(例:ラプラシアン)を用いて抽出され、固定モデルをガイドする明示的なプロンプト信号として使用される。

実験結果

リサーチクエスチョン

  • RQ1統合的かつパラメータ効率的な手法が、複数の低レベル構造セグメンテーションタスクで最先端の性能を達成できるか?
  • RQ2高周波成分や固定パッチ特徴といった明示的な画像コンテンツに基づくプロンプトが、一般的な学習可能プロンプトトークンを上回る性能を発揮するか?
  • RQ3チューニング段階とアダプタアーキテクチャの選択が、低レベルセグメンテーションの性能にどのように影響するか?
  • RQ4EVPは、シンプルなViTと階層的SegFormerを含む、さまざまなビジョン Transformerバックボーンに一般化可能か?
  • RQ5スケーリング要因 $ r $ を用いてトレーニング可能なパラメータ数を制御する際、モデルサイズと性能の最適なトレードオフは何か?

主な発見

  • EVPは、4つの低レベルセグメンテーションタスクにまたがる9つの多様なデータセットで最先端の性能を達成し、タスク特化型モデルおよび他のプロンプトチューニングベースラインを上回る。
  • ベースライン手法に比べて僅かに5.7%多いトレーニング可能なパラメータで、4つのデータセットのうち3つでフルファインチューニングを上回り、残り1つでは同等の性能を達成した。
  • 固定パッチ埋め込み特徴 ($ F_{pe} $) または高周波成分 ($ F_{hfc} $) のいずれかを除去すると、性能が著しく低下し、両者が不可欠であることが確認された。
  • $ r = 4 $ が性能とパラメータ効率の最良のトレードオフを提供する。$ r $ を1または2にさらに減らすと、性能が頭打ちまたは低下する。
  • アブレーションスタディにより、アダプタMLPを段階間で共有すると性能が低下することが確認され、各段階でのタスク特化型適応が重要であることが示された。
  • EVPはシンプルなViTバックボーンにも良好に一般化され、ViT-Baseを用いたSETRにおいてVPTおよびAdaptFormerを上回った。これにより、アーキテクチャの頑健性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。