Skip to main content
QUICK REVIEW

[論文レビュー] Relax Image-Specific Prompt Requirement in SAM: A Single Generic Prompt for Segmenting Camouflaged Objects

Jian Hu, Jiayi Lin|arXiv (Cornell University)|Dec 12, 2023
Visual Attention and Saliency Detection被引用数 4
ひとこと要約

本稿では、弱い教師付き camouflage 表現物体検出(WSCOD)における Segment Anything Model(SAM)の画像固有のプロンプトの必要性を排除する、テスト時適応フレームワーク Generalizable SAM(GenSAM)を提案する。Cross-modal Chains of Thought Prompting(CCTP)とProgressive Mask Generation(PMG)を用いることで、微調整や追加学習を一切行わずに、単一の汎用的テキストプロンプトから正確な視覚的プロンプトを自動生成し、スクラッチによる監視と同等の性能を達成する。

ABSTRACT

Camouflaged object detection (COD) approaches heavily rely on pixel-level annotated datasets. Weakly-supervised COD (WSCOD) approaches use sparse annotations like scribbles or points to reduce annotation effort, but this can lead to decreased accuracy. The Segment Anything Model (SAM) shows remarkable segmentation ability with sparse prompts like points. However, manual prompt is not always feasible, as it may not be accessible in real-world application. Additionally, it only provides localization information instead of semantic one, which can intrinsically cause ambiguity in interpreting the targets. In this work, we aim to eliminate the need for manual prompt. The key idea is to employ Cross-modal Chains of Thought Prompting (CCTP) to reason visual prompts using the semantic information given by a generic text prompt. To that end, we introduce a test-time adaptation per-instance mechanism called Generalizable SAM (GenSAM) to automatically enerate and optimize visual prompts the generic task prompt for WSCOD. In particular, CCTP maps a single generic text prompt onto image-specific consensus foreground and background heatmaps using vision-language models, acquiring reliable visual prompts. Moreover, to test-time adapt the visual prompts, we further propose Progressive Mask Generation (PMG) to iteratively reweight the input image, guiding the model to focus on the targets in a coarse-to-fine manner. Crucially, all network parameters are fixed, avoiding the need for additional training. Experiments demonstrate the superiority of GenSAM. Experiments on three benchmarks demonstrate that GenSAM outperforms point supervision approaches and achieves comparable results to scribble supervision ones, solely relying on general task descriptions as prompts. our codes is in: https://lwpyh.github.io/GenSAM/.

研究の動機と目的

  • 実世界のシナリオでは現実的でない、弱い教師付き camouflage 表現物体検出(WSCOD)における SAM の手動による画像固有のプロンプトの制限を解消すること。
  • ポイントやスクラッチなどの疎なアノテーションを、単一の汎用的タスク記述に置き換えることで、アノテーション負荷を低減すること。
  • ポイントなどの空間的プロンプトに意味的文脈が欠如していることによるプロンプト解釈の曖昧さを解消すること。
  • モデルの微調整なしに、テスト時にインスタンスごとの視覚的プロンプトを自動生成すること。
  • 汎用的テキストプロンプトのみを用いて、スクラッチによる監視と同等の高いセグメンテーション精度を達成すること。

提案手法

  • ビジョン・ラングエージュモデル(BLIP2 と CLIP)を用いて、汎用的テキストプロンプトから複数の意味的キーワードを生成するための Cross-modal Chains of Thought Prompting(CCTP)を導入する。
  • 異なるチェーンからのキーワードを統合するための新しい k-k-v セルフアテンション機構を用い、一貫性のある前景および背景のヒートマップを生成することで、個々のチェーンに起因する曖昧さを解消する。
  • Progressive Mask Generation(PMG)を適用し、一貫性のあるヒートマップを用いて入力画像を段階的に再重み付けすることで、SAM が粗い段階から細かい段階へとターゲットに焦点を当てるように誘導する。
  • 推論中にすべてのネットワークパラメータを固定し、微調整や追加学習なしにテスト時適応を可能にする。
  • 最終的な一貫性のあるヒートマップをアップサンプリングおよびしきい値処理によりポイントプロンプトに変換し、SAM のプロンプトインターフェースとの互換性を保証する。
  • 複数のプロンプト生成戦略(例:MaxIOUBox)を評価し、反復処理におけるマスクの一貫性を最適化する。

実験結果

リサーチクエスチョン

  • RQ1画像固有のプロンプトを必要とせず、性能劣化なしに、単一の汎用的テキストプロンプトが SAM における camouflage 表現物体セグメンテーションに置き換え可能か?
  • RQ2汎用的プロンプトからの意味的情報を、局所化の曖昧さを解消するための画像固有の視覚的プロンプトに効果的にマッピングする方法は何か?
  • RQ3反復的精錬を伴うテスト時適応は、モデルの微調整なしにどの程度セグメンテーション精度を向上させるか?
  • RQ4Chain-of-Thought プロンプティングにおけるチェーン数が、一貫性ヒートマップの品質および最終的なセグメンテーション性能に与える影響は何か?
  • RQ5提案手法は、camouflage 表現物体検出を越えて、他のセグメンテーションタスクにも一般化可能か?

主な発見

  • S-COD データセットにおいて、GenSAM は平均絶対誤差(MAE)を 0.025 に達成し、ポイントベースの監視を上回り、スクラッチベースの手法と同等の性能を示した。
  • CHAMELEON データセットでは、GenSAM が Fβ スコア 0.806 を達成し、CLIP Surgery+SAM(0.689)および SAM-P(0.712)を顕著に上回った。
  • 一貫性ヒートマップを視覚的プロンプトとして用いることで、ベースラインの CLIP Surgery+SAM に比べて性能が向上し、ポリープセグメンテーションの ETIS データセットでは MAE が 0.537 から 0.205 に低下した。
  • Progressive Mask Generation(PMG)は最初の 6 イタレーションで顕著な性能向上を示し、それ以降はほとんど向上が見られなかったため、6 イタレーションを最適な反復回数と正当化できる。
  • CCTP における k-k-v セルフアテンションを v-v-v セルフアテンションに置き換えると、Fβ スコアが 0.027 減少し、より優れた性能を示した。
  • アブレーションスタディにおいて、MaxIOUBox は他のボックスプロンプト生成戦略を上回り、最高の Fβ スコアおよび Sα スコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。