Skip to main content
QUICK REVIEW

[논문 리뷰] Unleashing Text-to-Image Diffusion Models for Visual Perception

Wenliang Zhao, Yongming Rao|arXiv (Cornell University)|2023. 03. 03.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 시각-언어 지식을 풍부하게 지닌 사전 훈련된 텍스트-이미지 확산 모델을 재사용하여 시각적 인식 작업을 수행하는 VPD 프레임워크를 제안한다. 전체 확산 노이즈 제거 파이프라인을 사용하지 않고, VPD는 노이즈 제거 UNet을 백본으로 사용하고, 텍스트를 프롬프트로 제공하며, 어댑터를 통해 텍스트 특징을 보정하고, 교차 attention 맵을 명시적 가이던스로 활용함으로써, 의미 분할, 참조 이미지 분할(73.3% oIoU), 깊이 추정(0.254 RMSE)에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Diffusion models (DMs) have become the new trend of generative models and have demonstrated a powerful ability of conditional synthesis. Among those, text-to-image diffusion models pre-trained on large-scale image-text pairs are highly controllable by customizable prompts. Unlike the unconditional generative models that focus on low-level attributes and details, text-to-image diffusion models contain more high-level knowledge thanks to the vision-language pre-training. In this paper, we propose VPD (Visual Perception with a pre-trained Diffusion model), a new framework that exploits the semantic information of a pre-trained text-to-image diffusion model in visual perception tasks. Instead of using the pre-trained denoising autoencoder in a diffusion-based pipeline, we simply use it as a backbone and aim to study how to take full advantage of the learned knowledge. Specifically, we prompt the denoising decoder with proper textual inputs and refine the text features with an adapter, leading to a better alignment to the pre-trained stage and making the visual contents interact with the text prompts. We also propose to utilize the cross-attention maps between the visual features and the text features to provide explicit guidance. Compared with other pre-training methods, we show that vision-language pre-trained diffusion models can be faster adapted to downstream visual perception tasks using the proposed VPD. Extensive experiments on semantic segmentation, referring image segmentation and depth estimation demonstrates the effectiveness of our method. Notably, VPD attains 0.254 RMSE on NYUv2 depth estimation and 73.3% oIoU on RefCOCO-val referring image segmentation, establishing new records on these two benchmarks. Code is available at https://github.com/wl-zhao/VPD

연구 동기 및 목표

  • 대규모 텍스트-이미지 확산 모델이 이미지-텍스트 쌍으로 사전 훈련된 후, 후행 시각적 인식 작업에 활용될 수 있는지 조사하는 것.
  • 확산 모델이 이미지 생성을 위해 설계되었지만, 의미 이해가 필요한 인식 작업으로 지식을 전이하는 데 도전하는 것.
  • 확산 모델과 기존 시각적 인식 프레임워크 간의 아키텍처 및 파이프라인 불일치 문제를 해결하는 것.
  • 텍스트 프롬프트와 교차 attention 맵을 명시적으로 활용하여 인식 작업에서 시각-언어 일치도를 향상시키는 것.
  • 시각-언어 사전 훈련된 확산 모델이 기존 사전 훈련 방법보다 더 빠르고 효과적으로 인식 작업에 적응시킬 수 있음을 보여주는 것.

제안 방법

  • 사전 훈련된 텍스트-이미지 확산 모델의 노이즈 제거 UNet(예: Stable Diffusion)을 자연 이미지의 특징 백본으로 재사용하며, 전체 확산 과정을 건너뛴다.
  • 자연어로 입력 이미지를 기술하는 프롬프트를 사용하여 노이즈 제거 과정을 유도하는 텍스트 프롬프트 엔지니어링 전략을 도입한다.
  • 학습 가능한 어댑터 모듈을 활용하여 텍스트 임bedding을 보정하고, UNet에서 추출한 시각적 특징과의 일치도를 향상시킨다.
  • 시각적 특징과 텍스트 특징 간의 교차 attention 맵을 후행 작업의 명시적 가이던스 신호로 활용한다.
  • UNet 디코더의 여러 레이어에서 특징을 조합하고, 업샘플링 및 다운샘플링 블록의 교차 attention 맵을 융합하여 표현력을 향상시킨다.
  • 입력 이미지를 직접 소비하고 인식 헤드용 의미 특징을 생성하는 단일 단계 노이즈 제거 추론 설정을 제안한다.

실험 결과

연구 질문

  • RQ1이미지 생성을 최적화하기 위해 설계된 사전 훈련된 텍스트-이미지 확산 모델이 의미 분할 및 깊이 추정과 같은 시각적 인식 작업으로 효과적으로 재사용될 수 있는가?
  • RQ2시각-언어 사전 훈련된 확산 모델에 인코딩된 고수준 의미 지식을 어떻게 추출하고, 이를 인식 작업의 시각적 입력과 일치시킬 수 있는가?
  • RQ3텍스트 프롬프트와 시각적 특징 간의 교차 attention 맵이 인식 벤치마크 성능 향상에 어떤 역할을 하는가?
  • RQ4기초 확산 모델의 사전 훈련 깊이에 따라 제안된 프레임워크의 성능이 스케일링되는가?
  • RQ5기존의 시각적 사전 훈련 파라다임에 비해 제안된 방법이 더 빠른 수렴과 뛰어난 정확도를 달성할 수 있는가?

주요 결과

  • VPD는 RefCOCO+val 참조 이미지 분할 벤치마크에서 73.3% oIoU의 새로운 최신 기술 수준 성능을 달성했다.
  • 깊이 추정에서 NYUv2에서 0.254 RMSE의 새로운 SOTA 성능을 기록하여 이전 방법들을 크게 앞서갔다.
  • 의미 분할(ADE20K) 벤치마크에서 다른 사전 훈련 베이스라인에 비해 더 빠른 수렴과 뛰어난 성능을 보였다.
  • 기초 확산 모델의 사전 훈련 반복 수가 길어질수록 성능 향상이 이루어졌으며, SD-1-1에서 SD-1-5로 전환할 때 mIoU@8K가 4점 이상 증가했다.
  • 업샘플링 및 다운샘플링 블록의 교차 attention 맵 모두가 긍정적인 기여를 하였고, 평균을 취한 결과가 가장 뛰어난 성능을 보였다.
  • 제안된 프레임워크의 성공은 모델의 용량 자체가 아니라, 확산 모델 내에 내재된 시각-언어 지식 덕분이며, 사전 훈련 깊이에 따른 스케일링 경향을 통해 이를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.