[論文レビュー] Learning to Prompt Segment Anything Models
本稿では、高次元埋め込み空間で最適化し、事前学習されたプロンプトエンコーダーを効果的に活用することで、Segment Anything Models (SAMs) のための最適な空間的・意味的プロンプトを学習する Spatial-Semantic Prompt Learning (SSPrompt) を提案する。SSPromptは、複数の少サンプルセグメンテーションベンチマークで最先端の性能を達成し、16ショット設定下での ADE20K データセットでベースラインを最大16.0 mIoU 上回った。
Segment Anything Models (SAMs) like SEEM and SAM have demonstrated great potential in learning to segment anything. The core design of SAMs lies with Promptable Segmentation, which takes a handcrafted prompt as input and returns the expected segmentation mask. SAMs work with two types of prompts including spatial prompts (e.g., points) and semantic prompts (e.g., texts), which work together to prompt SAMs to segment anything on downstream datasets. Despite the important role of prompts, how to acquire suitable prompts for SAMs is largely under-explored. In this work, we examine the architecture of SAMs and identify two challenges for learning effective prompts for SAMs. To this end, we propose spatial-semantic prompt learning (SSPrompt) that learns effective semantic and spatial prompts for better SAMs. Specifically, SSPrompt introduces spatial prompt learning and semantic prompt learning, which optimize spatial prompts and semantic prompts directly over the embedding space and selectively leverage the knowledge encoded in pre-trained prompt encoders. Extensive experiments show that SSPrompt achieves superior image segmentation performance consistently across multiple widely adopted datasets.
研究の動機と目的
- 2次元座標から高次元埋め込み空間への移行により、空間的プロンプト最適化における探索空間の制限を解消する。
- 前景オブジェクトの記述に偏った事前学習データに起因する、事前学習済みテキストプロンプトエンコーダーのバイアスを軽減する。
- 空間的および意味的プロンプトを同時に学習する統合フレームワークを構築し、セグメンテーション性能を向上させる。
- 事前学習済みプロンプトエンコーダーからの知識を効果的に選択的に活用することで、少サンプル設定下での有効なプロンプト学習を可能にする。
- 大規模なプロンプトエンコーダーの完全微調整を避けることで、高い性能を維持しつつ、訓練効率を向上させる。
提案手法
- SpaPrompt を導入:固定された空間的プロンプトエンコーダーからのデフォルトの空間的プロンプト埋め込みと、学習可能な空間的プロンプト埋め込みを、512次元の埋め込み空間で融合する可学習重みを導入する。
- SemPrompt を導入:固定されたテキストプロンプトエンコーダーからのデフォルトの意味的プロンプト埋め込みと、学習可能な意味的プロンプト埋め込みを組み合わせ、最適化された意味的プロンプトを形成する。
- 空間的および意味的プロンプトを埋め込み空間で同時に最適化することで、2次元座標最適化よりも大きな探索空間を実現する。
- 可学習重みによる選択的融合を用い、プロンプトエンコーダーが事前に学習した前景知識を効果的に活用しながら、 poorly-learned 背景知識の影響を最小限に抑える。
- 大規模な事前学習済みプロンプトエンコーダーの微調整を避けることで、推論効率を維持し、小さな学習可能なプロンプト埋め込みのみを更新する。
- 各クラスの少数のアノテーション付きサンプルのみを用いて学習することで、多様なデータセットにわたる少サンプル適応を可能にする。
実験結果
リサーチクエスチョン
- RQ12次元座標最適化と比較して、高次元埋め込み空間で空間的プロンプトを最適化することで、セグメンテーション性能がどのように向上するか?
- RQ2事前学習済みテキストプロンプトエンコーダーが、前景中心の事前学習データに起因してどれほどバイアスを生じさせるのか、そしてそのバイアスはどのように軽減できるか?
- RQ3空間的および意味的プロンプトの共同学習は、セグメンテーション精度の補完的向上をもたらすか?
- RQ4本手法は、特に少サンプル設定下の低データレジームでどのように性能を発揮するか?
- RQ5完全微調整と比較して、選択的プロンプト学習を用いる場合の、性能向上と訓練効率のトレードオフはいかなるものか?
主な発見
- SSPrompt は、16ショット設定下で ADE20K で 55.2 mIoU を達成し、ベースラインの SEEM-T を 16.0 mIoU 上回った。
- Cityscapes では、16ショット下で mIoU を SEEM-T の 39.2 から 55.2 まで向上させ、複数のデータセットで一貫した向上を示した。
- 4ショットデータでも優れた性能を維持しており、低データレジームにおける強力な一般化能力を示した。
- SEEM-T と比較して、訓練時間は 36.0% 減少し、メモリ使用量は 53.5% 減少した。これは、エンコーダーの完全微調整を避けることで実現された。
- 可視化されたアテンション重みは、前景クラスでは高い値、背景では低い値を示しており、well-learned 知識の選択的利用が確認された。
- アブレーションスタディにより、SemPrompt および SpaPrompt の可学習重みが性能に不可欠であることが確認された。これらは、 poorly-learned 背景知識の悪影響を避けるとともに、選択的知識利用を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。