[논문 리뷰] Controllable Generation with Text-to-Image Diffusion Models: A Survey
이 종합적 서베이는 제어 가능한 텍스트-이미지 확산 모델에 대한 포괄적인 분석을 제공하며, 텍스트 조건 외에도 이미지, 레이아웃, 스케치와 같은 다양한 입력을 포함하는 방법을 체계적으로 분류한다. 조건부 스코어 예측 및 조건 유도 스코어 추정과 같은 이론적 메커니즘을 상세히 설명하며, 새로운 조건이 고정밀도 및 유연도를 갖춘 이미지 생성을 어떻게 이끄는지 이해하기 위한 통합 프레임워크를 제공한다.
In the rapidly advancing realm of visual generation, diffusion models have revolutionized the landscape, marking a significant shift in capabilities with their impressive text-guided generative functions. However, relying solely on text for conditioning these models does not fully cater to the varied and complex requirements of different applications and scenarios. Acknowledging this shortfall, a variety of studies aim to control pre-trained text-to-image (T2I) models to support novel conditions. In this survey, we undertake a thorough review of the literature on controllable generation with T2I diffusion models, covering both the theoretical foundations and practical advancements in this domain. Our review begins with a brief introduction to the basics of denoising diffusion probabilistic models (DDPMs) and widely used T2I diffusion models. We then reveal the controlling mechanisms of diffusion models, theoretically analyzing how novel conditions are introduced into the denoising process for conditional generation. Additionally, we offer a detailed overview of research in this area, organizing it into distinct categories from the condition perspective: generation with specific conditions, generation with multiple conditions, and universal controllable generation. For an exhaustive list of the controllable generation literature surveyed, please refer to our curated repository at https://github.com/PRIV-Creation/Awesome-Controllable-T2I-Diffusion-Models.
연구 동기 및 목표
- 텍스트-이미지 확산 모델에서 텍스트 조건 외에 복잡한 시각적 요구사항(특정 스타일, 알려지지 않은 정체성 등)을 포착하지 못하는 한계를 해결하기 위해.
- 조건 입력 유형에 따라 분류된 제어 가능한 생성 방법의 체계적 분류 체계를 제공하기 위해(예: 단일 조건(예: 텍스트, 이미지, 레이아웃), 다중 조건(예: 텍스트 + 스케치), 통합 제어(예: 통합 조건 헤드)).
- 확산 모델에 조건 통합의 이론적 기초를 분석하기 위해, 특히 조건부 스코어 예측 및 조건 유도 스코어 추정에 집중한다.
- 이미지 편집, 인painting, 구성, 텍스트/이미지-3D 생성 등 다양한 응용 분야의 실질적 응용을 조사하여 실생활 유용성과 기술적 혁신을 부각하기 위해.
- 연구자 및 실무자들을 위해 제어 가능한 T2I 확산 문헌의 종합적이고 최신의 레포지토리를 편집 및 정리하기 위해.
제안 방법
- 조건 유형에 따라 제어 가능한 생성 방법을 분류: 단일 조건(예: 텍스트, 이미지, 레이아웃), 다중 조건(예: 텍스트 + 스케치), 통합 제어(예: 통합 조건 헤드).
- 조건부 스코어 예측을 통한 신규 조건의 통합 이론화: 모델이 보조 입력에 조건이 붙은 노이즈 제거 단계의 스코어를 추정한다.
- 조건 유도 스코어 추정 분석: 분류기 자유 가이던스와 같은 가이던스 메커니즘을 사용해 노이즈 제거 과정을 수정함으로써, 복잡한 조건에 맞게 생성을 정렬한다.
- 어댑터 모듈, U-Net에 조건 주입, 공간 제어를 위한 전용 헤드(예: ControlNet) 등의 아키텍처 적응을 검토한다.
- Score Distillation Sampling(SDS) 손실이 2D 확산 제어 메커니즘을 3D 공간으로 전이함으로써 3D 생성에 대한 텍스트-3D 생성 가능성을 가능하게 함을 분석한다.
- DreamInpainter, Realfill, Uni-inpaint와 같은 기법을 평가하여 기준 이미지와 다중 조건을 활용해 마스킹된 영역의 생성을 유도한다.
실험 결과
연구 질문
- RQ1텍스트-이미지 확산 모델은 텍스트 조건 외에도 스케치, 레이아웃, 기준 이미지와 같은 다양한 시각적 조건을 지원할 수 있도록 어떻게 확장될 수 있는가?
- RQ2노이즈 제거 과정에 새로운 조건을 효과적으로 통합하는 데 핵심이 되는 이론적 메커니즘(예: 조건부 스코어 예측, 조건 유도 스코어 추정)은 무엇인가?
- RQ3사전 훈련된 T2I 모델이 다중 조건 또는 통합 제어 가능한 생성에 적응할 수 있도록 허용하는 주요 아키텍처 및 훈련 전략는 무엇인가?
- RQ4제어 가능한 생성 방법은 이미지 편집, 인painting, 구성, 텍스트/이미지-3D 생성과 같은 후행 작업을 어떻게 향상시키는가?
- RQ5SDS 기법을 활용해 2D 확산 모델의 제어를 3D 생성으로 전이하는 데 가장 효과적이고 일반화 가능한 접근 방식은 무엇인가?
주요 결과
- 텍스트 외에도 기준 이미지, 스케치, 레이아웃과 같은 다양한 조건을 통합하면 이미지 생성의 정밀도와 유연성이 크게 향상된다.
- 특히 분류기 자유 가이던스를 통한 조건 유도 스코어 추정은 추가적인 분류기 훈련 없이도 강력하고 제어 가능한 생성을 가능하게 한다.
- ControlNet과 Uni-inpaint와 같은 기법들은 텍스트 + 레이아웃 + 스케치와 같은 다중 조건 제어가 더 일관되고 의미적으로 일치하는 이미지 완성 및 편집을 가능하게 함을 보여준다.
- Score Distillation Sampling(SDS) 손실의 사용은 2D 확산 제어 메커니즘을 3D 생성으로 전이함으로써, 최소한의 3D 레이블링으로도 텍스트-3D 생성을 실현 가능하게 한다.
- ObjectStitch와 ControlCom는 사전 훈련된 T2I 모델의 어댑터 기반 미세조정이 조명, 그림자, 시점 정렬과 같은 복잡한 구성 작업을 통합하는 데 효과적임을 보여준다.
- 이 서베이에서 정리한 레포지토리(https://github.com/PRIV-Creation/Awesome-Controllable-T2I-Diffusion-Models)는 제어 가능한 T2I 생성 분야의 최신 기술 상태를 종합적으로 제공하는 최신 기준 자료이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.