Skip to main content
QUICK REVIEW

[논문 리뷰] Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter

Jinglong Wang, Xiawei Li|arXiv (Cornell University)|2023. 09. 06.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 Stable Diffusion과 같은 사전 훈련된 텍스트-이미지 확산 모델을 활용하여, 노이즈 제거 U-Net 내의 자기주의 및 상호주의 맵에서 세그멘테이션 맵을 추출함으로써, 추가 훈련 없이도 개방형 어휘(open-vocabulary) 세그멘테이션을 수행할 수 있는 DiffSegmenter를 소개한다. 이는 PASCAL VOC 2012, MS COCO 2014, Pascal Context에서 약 70.49%의 mIoU 성능을 달성하며, 추가 훈련 또는 파라미터 없이 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

The pre-trained text-image discriminative models, such as CLIP, has been explored for open-vocabulary semantic segmentation with unsatisfactory results due to the loss of crucial localization information and awareness of object shapes. Recently, there has been a growing interest in expanding the application of generative models from generation tasks to semantic segmentation. These approaches utilize generative models either for generating annotated data or extracting features to facilitate semantic segmentation. This typically involves generating a considerable amount of synthetic data or requiring additional mask annotations. To this end, we uncover the potential of generative text-to-image diffusion models (e.g., Stable Diffusion) as highly efficient open-vocabulary semantic segmenters, and introduce a novel training-free approach named DiffSegmenter. The insight is that to generate realistic objects that are semantically faithful to the input text, both the complete object shapes and the corresponding semantics are implicitly learned by diffusion models. We discover that the object shapes are characterized by the self-attention maps while the semantics are indicated through the cross-attention maps produced by the denoising U-Net, forming the basis of our segmentation results.Additionally, we carefully design effective textual prompts and a category filtering mechanism to further enhance the segmentation results. Extensive experiments on three benchmark datasets show that the proposed DiffSegmenter achieves impressive results for open-vocabulary semantic segmentation.

연구 동기 및 목표

  • 대비 학습에 의해 국소화 및 형태 인식 능력을 상실하는 CLIP와 같은 판별 모델의 한계를 해결하기 위해.
  • 확산 모델이 암묵적으로 객체의 형태와 의미를 학습하고 있음을 고려할 때, 이러한 모델이 효율적이고 훈련 없이도 세그멘테이션 모델로 기능할 수 있는지 탐색하기 위해.
  • 추가 훈련이나 학습 가능한 구성 요소 없이도 사전 훈련된 확산 모델에서 픽셀 수준의 세그멘테이션 맵을 추출하는 방법을 개발하기 위해.
  • BLIP 모델을 사용한 효과적인 텍스트 프롬프트 설계 및 카테고리 필터링을 통해 세그멘테이션 품질을 향상시키기 위해.
  • 제어 가능한 이미지 편집과 같은 후행 작업에서의 유용성을 입증하기 위해.

제안 방법

  • 모델은 확산 모델 내의 노이즈 제거 U-Net에서 자기주의 맵(객체 형태를 나타냄)과 상호주의 맵(의미를 나타냄)을 조합하여 세그멘테이션 점수 맵을 추출한다.
  • 베이즈 정리 $p(c|x)$를 활용해 조건부 생성 과정 $p(x|c)$를 역으로 뒤집어, 픽셀 수준의 카테고리 예측을 위한 의미 세그멘테이션 사후확률 $p(c|x)$를 도출한다.
  • 다양한 특징 맵 해상도(8×8, 16×16, 32×32, 64×64)에서의 상호주의 맵을 경험적으로 조정된 가중치 [0.3, 0.5, 0.1, 0.1]를 사용해 가중합하여 의미 표현을 향상시킨다.
  • 모든 레이어의 자기주의 맵($\widehat{\mathcal{A}}_{all}^{self}$)을 통합하여 경계의 완전성과 형태 인식 능력을 향상시킨다.
  • 텍스트 프롬프트는 BLIP 모델을 사용해 조건부 캡션을 생성하고, 클래스 토큰을 재가중하여 목표 카테고리 강조 및 배경 활성화 억제를 수행한다.
  • 추론은 속도를 위해 제로샷 모드에서는 단일 노이즈 제거 단계(t=100)를 사용하거나, 약간의 성능 향상을 위해 약 4단계(t=1, 50, 100, 150)의 평균을 내어 약화된 감독 설정에서 활용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 텍스트-이미지 확산 모델이 세그멘테이션을 위한 명시적 훈련 없이도 객체의 형태와 의미 정보를 암묵적으로 학습할 수 있는가?
  • RQ2노이즈 제거 U-Net의 주의 맵을 어떻게 활용하여 정확하고 훈련 없이도 세그멘테이션 맵을 생성할 수 있는가?
  • RQ3자기주의 맵과 상호주의 맵이 각각 형태와 의미를 어떻게 포착하여 세그멘테이션에 기여하는가?
  • RQ4BLIP를 활용한 프롬프트 엔지니어링 및 클래스 토큰 재가중이 세그멘테이션 정확도와 카테고리 특이성에 어떤 영향을 미치는가?
  • RQ5이 방법은 기존의 판별 및 생성 기반 기준 모델보다 우수한 성능을 보이며, 약화된 감독 및 제로샷 설정에서도 일반화 가능한가?

주요 결과

  • 약화된 감독 설정에서 MS COCO 2014 데이터셋에서 4단계 노이즈 제거 시간(t=1, 50, 100, 150)의 결과를 평균 내어 mIoU 70.49%를 달성한다.
  • 다양한 해상도에서의 상호주의 맵을 가중합하면 단순 평균화보다 성능 향상이 뚜렷하며, 8×8 및 16×16 특징에 가장 높은 가중치가 할당된다.
  • 모든 레이어의 자기주의 맵($\widehat{\mathcal{A}}_{all}^{self}$)을 통합하면 특히 객체 경계의 품질 향상에 기여하여 세그멘테이션 품질이 크게 향상된다.
  • 제로샷 설정에서 최고의 성능은 t=100에서 달성되며, mIoU 70.30%를 기록하고, 여러 단계의 평균을 내면 성능이 더욱 향상된다.
  • 프롬프트-투-프롬프트(PTP)보다 더 정확한 전경 마스크를 생성함으로써 더 정밀하고 완전한 전경 마스크를 제공함으로써 더 정확한 이미지 편집이 가능하다.
  • 추가적인 미세조정이나 추가 파라미터 없이도, 광범위한 훈련이나 마스크 애너테이션을 필요로 하는 최신 기술 수준의 방법들과 경쟁 가능한 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.