Skip to main content
QUICK REVIEW

[논문 리뷰] Relax Image-Specific Prompt Requirement in SAM: A Single Generic Prompt for Segmenting Camouflaged Objects

Jian Hu, Jiayi Lin|arXiv (Cornell University)|2023. 12. 12.
Visual Attention and Saliency Detection인용 수 4
한 줄 요약

이 논문은 약한 지도 학습 기반 은폐된 객체 검출을 위한 Segment Anything Model(SAM)에서 이미지별로 특화된 프롬프트가 필요 없도록 하는 일반화 가능한 SAM(GenSAM)을 제안한다. Cross-modal Chains of Thought Prompting(CCTP)과 Progressive Mask Generation(PMG)를 통해 GenSAM은 단일 일반화된 텍스트 프롬프트에서 자동으로 정확한 시각적 프롬프트를 생성하며, 미세조정이나 추가 학습 없이도 스크래치 지도 학습 수준의 성능을 달성한다.

ABSTRACT

Camouflaged object detection (COD) approaches heavily rely on pixel-level annotated datasets. Weakly-supervised COD (WSCOD) approaches use sparse annotations like scribbles or points to reduce annotation effort, but this can lead to decreased accuracy. The Segment Anything Model (SAM) shows remarkable segmentation ability with sparse prompts like points. However, manual prompt is not always feasible, as it may not be accessible in real-world application. Additionally, it only provides localization information instead of semantic one, which can intrinsically cause ambiguity in interpreting the targets. In this work, we aim to eliminate the need for manual prompt. The key idea is to employ Cross-modal Chains of Thought Prompting (CCTP) to reason visual prompts using the semantic information given by a generic text prompt. To that end, we introduce a test-time adaptation per-instance mechanism called Generalizable SAM (GenSAM) to automatically enerate and optimize visual prompts the generic task prompt for WSCOD. In particular, CCTP maps a single generic text prompt onto image-specific consensus foreground and background heatmaps using vision-language models, acquiring reliable visual prompts. Moreover, to test-time adapt the visual prompts, we further propose Progressive Mask Generation (PMG) to iteratively reweight the input image, guiding the model to focus on the targets in a coarse-to-fine manner. Crucially, all network parameters are fixed, avoiding the need for additional training. Experiments demonstrate the superiority of GenSAM. Experiments on three benchmarks demonstrate that GenSAM outperforms point supervision approaches and achieves comparable results to scribble supervision ones, solely relying on general task descriptions as prompts. our codes is in: https://lwpyh.github.io/GenSAM/.

연구 동기 및 목표

  • 실제 환경에서 비현실적인 이미지별로 특화된 프롬프트가 필요한 SAM의 약한 지도 학습 기반 은폐된 객체 검출(WSCOD)의 한계를 해결한다.
  • 점이나 스크래치와 같은 희박한 애너테이션을 단일 일반화된 작업 기술로 대체하여 애너테이션 부담을 줄인다.
  • 점과 같은 공간적 프롬프트에서 의미적 맥락이 부족해 발생하는 프롬프트 해석의 모호성을 제거한다.
  • 모델의 미세조정 없이도 테스트 시에 자동으로 개별 인스턴스별로 시각적 프롬프트를 생성한다.
  • 단일 일반화된 텍스트 프롬프트만으로도 스크래치 지도 학습 수준의 높은 세그멘테이션 정확도를 달성한다.

제안 방법

  • 비전-언어 모델(BLIP2와 CLIP)을 사용하여 일반화된 텍스트 프롬프트에서 여러 의미적 키워드를 생성하기 위해 Cross-modal Chains of Thought Prompting(CCTP)을 도입한다.
  • 다양한 체인에서 유도된 키워드를 일致된 전경 및 배경 히트맵으로 융합하기 위해 새로운 k-k-v 자기어텐션 메커니즘을 사용하여 개별 체인에서 발생하는 모호성을 해결한다.
  • 일致된 히트맵을 사용해 입력 이미지를 반복적으로 재가중함으로써 PMG(Progressive Mask Generation)를 적용하여 SAM이 거칠기부터 정밀하게 대상에 집중하도록 이끈다.
  • 추론 중 모든 네트워크 파라미터를 고정하여, 추가적인 미세조정이나 학습 없이도 테스트 시 적응을 가능하게 한다.
  • 최종 일치 히트맵을 업샘플링 및 임계값 처리를 통해 점 프롬프트로 변환하여 SAM의 프롬프트 인터페이스와의 호환성을 확보한다.
  • 다양한 프롬프트 생성 전략(예: MaxIOUBox)을 평가하여 반복 과정에서 마스크 일致성을 향상시킨다.

실험 결과

연구 질문

  • RQ1은폐된 객체 세그멘테이션에서 이미지별로 특화된 프롬프트가 필요 없이 성능 저하 없이 단일 일반화된 텍스트 프롬프트로 SAM를 대체할 수 있는가?
  • RQ2일반화된 프롬프트에서 유도된 의미 정보를 어떻게 효과적으로 이미지별로 특화된 시각적 프롬프트로 매핑하여 국소화의 모호성을 해결할 수 있는가?
  • RQ3반복적 개선을 통한 테스트 시 적응이 모델의 미세조정 없이 세그멘테이션 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4Chain-of-Thought 프롬프팅에서 체인의 수가 일치 히트맵의 품질과 최종 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 은폐된 객체 검출을 초과하는 다른 세그멘테이션 작업으로 일반화 가능한가?

주요 결과

  • S-COD 데이터셋에서 GenSAM은 평균 절대 오차(MAE) 0.025를 기록하며, 점 기반 지도 학습을 능가하고 스크래치 기반 방법과 동등한 성능을 달성한다.
  • CHAMELEON 데이터셋에서 GenSAM은 Fβ 점수 0.806을 기록하며, CLIP Surgery+SAM(0.689)과 SAM-P(0.712)를 상당히 앞서며 성능을 뛰어넘는다.
  • 일치 히트맵을 시각적 프롬프트로 사용함으로써 기존 CLIP Surgery+SAM 대비 성능 향상을 이끌었으며, 폴립 세그멘테이션에서 ETIS에서 MAE가 0.537에서 0.205로 감소했다.
  • Progressive Mask Generation(PMG)는 첫 6회 반복 이내에서 성능 향상이 두드러지며, 그 이후로는 최소한의 향상이 관찰되어 6회 반복을 최적의 수로 정당화한다.
  • CCTP에서 k-k-v 자기어텐션을 사용할 경우 v-v-v 자기어텐션보다 더 뛰어난 성능을 보였으며, 이를 대체할 경우 Fβ 점수는 0.027 감소했다.
  • Ablation 연구에서 MaxIOUBox는 다른 박스 프롬프트 생성 전략보다 뛰어난 성능을 보이며 가장 높은 Fβ 및 Sα 점수를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.