Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Prompt Segment Anything Models

Jiaxing Huang, Kai Jiang|arXiv (Cornell University)|2024. 01. 09.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 고차원 임bedding 공간에서 최적의 공간적 및 의미적 프롬프트를 학습함으로써 Segment Anything Models(SAMs)에 적합한 Spatial-Semantic Prompt Learning(SSPrompt)을 제안한다. 또한 사전 훈련된 프롬프트 인코더를 선택적으로 활용한다. SSPrompt는 여러 소수의 분할 벤치마크에서 최신 기술 수준의 성능을 달성하며, 16-shot 설정에서 ADE20K에서 최대 16.0 mIoU의 성능 향상을 기록한다.

ABSTRACT

Segment Anything Models (SAMs) like SEEM and SAM have demonstrated great potential in learning to segment anything. The core design of SAMs lies with Promptable Segmentation, which takes a handcrafted prompt as input and returns the expected segmentation mask. SAMs work with two types of prompts including spatial prompts (e.g., points) and semantic prompts (e.g., texts), which work together to prompt SAMs to segment anything on downstream datasets. Despite the important role of prompts, how to acquire suitable prompts for SAMs is largely under-explored. In this work, we examine the architecture of SAMs and identify two challenges for learning effective prompts for SAMs. To this end, we propose spatial-semantic prompt learning (SSPrompt) that learns effective semantic and spatial prompts for better SAMs. Specifically, SSPrompt introduces spatial prompt learning and semantic prompt learning, which optimize spatial prompts and semantic prompts directly over the embedding space and selectively leverage the knowledge encoded in pre-trained prompt encoders. Extensive experiments show that SSPrompt achieves superior image segmentation performance consistently across multiple widely adopted datasets.

연구 동기 및 목표

  • 2D 좌표에서의 최적화에 비해 고차원 임베딩 공간으로의 전환을 통해 공간 프롬프트 최적화의 제한된 탐색 공간 문제를 해결한다.
  • 전경 객체 기술에 치우친 사전 훈련된 텍스트 프롬프트 인코더에서 유도되는 부작용을 완화한다.
  • 공간적 및 의미적 프롬프트를 동시에 학습함으로써 향상된 분할 성능를 위한 통합 프레임워크를 개발한다.
  • 사전 훈련된 프롬프트 인코더의 지식을 선택적으로 활용하여 소수의 프롬프트 학습을 효과적으로 가능하게 한다.
  • 큰 프롬프트 인코더의 전체 미세조정을 피하면서도 높은 성능를 유지함으로써 훈련 효율성을 향상시킨다.

제안 방법

  • SpaPrompt 도입: 고정된 공간 프롬프트 인코더에서 유도된 기본 공간 프롬프트 임베딩과 학습 가능한 공간 프롬프트 임베딩을 512차원 임베딩 공간에서 융합하는 가속 가능한 가중치를 도입한다.
  • SemPrompt 도입: 고정된 텍스트 프롬프트 인코더에서 유도된 기본 의미 프롬프트 임베딩과 학습 가능한 의미 프롬프트 임베딩을 결합하여 최적화된 의미 프롬프트를 형성한다.
  • 공간적 및 의미적 프롬프트를 임베딩 공간에서 동시에 최적화함으로써 2D 좌표 최적화보다 더 큰 탐색 공간을 확보한다.
  • 학습 가능한 가중치를 통한 선택적 융합을 활용하여 프롬프트 인코더에서 잘 학습된 전경 지식을 활용하면서도, 잘 학습되지 않은 배경 지식의 영향을 최소화한다.
  • 큰 사전 훈련된 프롬프트 인코더의 미세조정을 피함으로써 추론 효율성을 유지하며, 오직 작은 학습 가능한 프롬프트 임베딩만 업데이트한다.
  • 각 클래스당 소수의 애너테이션 샘플만을 사용하여 훈련함으로써 다양한 데이터셋에 걸쳐 소수의 적응이 가능하다.

실험 결과

연구 질문

  • RQ1고차원 임베딩 공간에서 공간 프롬프트를 최적화하는 것이 2D 좌표 최적화에 비해 분할 성능 향상에 어떻게 기여하는가?
  • RQ2사전 훈련된 텍스트 프롬프트 인코더가 전경 중심의 훈련 데이터로 인해 얼마나 심각한 편향을 유도하는가? 그리고 이를 어떻게 완화할 수 있는가?
  • RQ3공간적 및 의미적 프롬프트의 동시 학습이 분할 정확도 향상에 상호 보완적인 효과를 줄 수 있는가?
  • RQ4저자료 환경, 특히 소수의 설정에서 제안된 방법의 성능는 어떠한가?
  • RQ5전체 미세조정 대비 선택적 프롬프트 학습을 사용할 경우 성능 향상과 훈련 효율성 간의 상충 관계는 어떠한가?

주요 결과

  • SSPrompt는 16-shot 설정에서 ADE20K에서 55.2 mIoU를 기록하며, 베이스라인인 SEEM-T보다 16.0 mIoU 높은 성능를 달성한다.
  • Cityscapes에서는 16-shot 설정에서 mIoU를 SEEM-T의 39.2에서 55.2로 향상시켜 다양한 데이터셋에서 일관된 성능 향상을 보였다.
  • 단지 4-shot 데이터로도 우수한 성능를 유지하여 저자료 환경에서 강력한 일반화 능력을 입증하였다.
  • 전체 인코더 미세조정을 피함으로써 훈련 시간은 36.0% 감소하고 메모리는 53.5% 감소하였다.
  • 시각화된 어텐션 가중치는 전경 클래스에 대해 높은 값을 보이며 배경에 대해서는 낮은 값을 보여, 잘 학습된 지식의 선택적 활용이 확인되었다.
  • 제거 실험 결과, SemPrompt 및 SpaPrompt의 학습 가능한 가중치가 성능 향상에 필수적임을 입증하였으며, 이는 악성 영향을 미칠 수 있는 잘 학습되지 않은 배경 지식의 영향을 방지하는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.