Skip to main content
QUICK REVIEW

[논문 리뷰] Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors

Ryan Burgert, Kanchana Ranasinghe|arXiv (Cornell University)|2022. 11. 23.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

이 논문은 재학습 없이도 사전 훈련된 텍스트-이미지 확산 모델(특히 Stable Diffusion)을 활용하여 의미적 및 참조 분할을 수행할 수 있는 새로운 제로샷, 오픈보라, 비지도 학습 방법인 Peekaboo를 소개한다. 유사도 기반 손실 함수를 활용한 추론 시 최적화를 통해 자연어 프롬프트에서 정밀한 분할 마스크를 생성하며, Pascal VOC-C와 RefCOCO에서 경쟁력 있는 성능을 기록한다. 또한 RGB 데이터로만 훈련된 확산 모델을 통해 투명도를 갖춘 RGBA 이미지를 종단 간 생성하는 최초의 엔드 투 엔드 결과를 보여준다.

ABSTRACT

Recently, text-to-image diffusion models have shown remarkable capabilities in creating realistic images from natural language prompts. However, few works have explored using these models for semantic localization or grounding. In this work, we explore how an off-the-shelf text-to-image diffusion model, trained without exposure to localization information, can ground various semantic phrases without segmentation-specific re-training. We introduce an inference time optimization process capable of generating segmentation masks conditioned on natural language prompts. Our proposal, Peekaboo, is a first-of-its-kind zero-shot, open-vocabulary, unsupervised semantic grounding technique leveraging diffusion models without any training. We evaluate Peekaboo on the Pascal VOC dataset for unsupervised semantic segmentation and the RefCOCO dataset for referring segmentation, showing results competitive with promising results. We also demonstrate how Peekaboo can be used to generate images with transparency, even though the underlying diffusion model was only trained on RGB images - which to our knowledge we are the first to attempt. Please see our project page, including our code: https://ryanndagreat.github.io/peekaboo

연구 동기 및 목표

  • 사전 훈련된 텍스트-이미지 확산 모델이 의미어에 대한 공간적 국소화 정보를 내재적으로 포함하고 있는지 탐구한다.
  • 세그멘테이션 전용 미세조정이나 애너테이션 없이 제로샷, 오픈보라, 비지도 학습 분할 방법을 개발한다.
  • 확산 모델이 복잡한 자연어 프롬프트에 대한 픽셀 수준의 국소화를 위해 활용될 수 있음을 보여준다.
  • RGB 이미지로만 훈련된 모델을 사용해 투명도를 갖춘 RGBA 이미지를 종단 간 생성할 수 있도록 한다.

제안 방법

  • Peekaboo는 사전 훈련된 Stable Diffusion 모델에 대해 추론 시 최적화를 수행하여 텍스트 프롬프트에서 분할 마스크를 생성한다.
  • 최적화 과정 중 알파 마스크 학습을 향상시키기 위해 새로운 알파 컴posit링 기반 손실 함수를 도입한다.
  • 고정 배경 이미지와 복합화된 가분산 알파 마스크를 최적화하여 복합 이미지를 생성한다.
  • 텍스트 프롬프트와 생성된 이미지 영역 간의 다중 모odal 유사도를 위해 스코어 디스틸레이션 손실(SDL)을 사용한다.
  • 최적화 과정은 텍스트 프롬프트와 생성된 이미지 간의 일치도를 극대화하도록 알파 마스크를 반복적으로 업데이트한다.
  • 이 방법은 실제 이미지(분할용)와 합성 이미지 복합체(투명 이미지 생성용)에 모두 적용된다.

실험 결과

연구 질문

  • RQ1Stable Diffusion과 같은 사전 훈련된 텍스트-이미지 확산 모델을 재학습 없이 제로샷 의미적 및 참조 분할에 사용할 수 있는가?
  • RQ2확산 모델의 내부 표현이 자연어 어휘에 대한 암묵적인 공간적 국소화 정보를 포함하고 있는가?
  • RQ3RGB 이미지로만 훈련된 확산 모델을 최적화를 통해 투명도를 갖춘 이미지(_RGBA) 생성에 사용할 수 있는가?
  • RQ4제안된 알파 컴포지팅 기반 손실은 기존 CLIP 기반 손실 대비 분할 성능에서 어떻게 비교되는가?
  • RQ5프롬프트의 복잡도와 객체의 위치(예: 중심 대비 가장자리)가 분할 정확도에 미치는 영향은 무엇인가?

주요 결과

  • Peekaboo는 모델 미세조정 없이도 RefCOCO 참조 분할 벤치마크와 수정된 Pascal VOC-C 비지도 의미 분할 벤치마크에서 경쟁력 있는 성능을 달성한다.
  • 이 방법은 '모자 없는 검은색 셔츠와 검은 바지를 입은 수염이 있는 남자'와 같은 복잡한 복합 어휘를 고도로 정밀한 공간 정확도로 성공적으로 분할한다.
  • Peekaboo는 강력한 형태 사전 지식을 보이며, 원본 이미지에서 일부가 가림되거나 보이지 않는 경우에도 객체를 정확히 분할할 수 있다.
  • 모델는 RGB 데이터로만 훈련된 확산 모델임에도 불구하고 종단 간 최적화를 통해 현실적인 투명도를 갖춘 RGBA 이미지를 생성할 수 있으며, 이는 RGB 데이터로만 훈련된 확산 모델에 있어 최초의 결과이다.
  • 알파 컴포지팅 기반 손실은 이전의 CLIP 기반 최적화 방법 대비 분할 품질과 수렴 속도에서 뛰어난 성능을 보인다.
  • 객체가 이미지 중심에 위치할 경우 분할 정확도가 가장 높으며, 이는 모델 내부 국소화 행동에 편향이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.