[논문 리뷰] A Survey of Diffusion Based Image Generation Models: Issues and Their Solutions
이 논문은 확산 기반 이미지 생성을 분석하고 주요 도전 과제(다중 객체 생성, 희귀 개념, 및 품질)를 식별하며 이를 해결하기 위한 솔루션과 기법을 조사한다.
Recently, there has been significant progress in the development of large models. Following the success of ChatGPT, numerous language models have been introduced, demonstrating remarkable performance. Similar advancements have also been observed in image generation models, such as Google's Imagen model, OpenAI's DALL-E 2, and stable diffusion models, which have exhibited impressive capabilities in generating images. However, similar to large language models, these models still encounter unresolved challenges. Fortunately, the availability of open-source stable diffusion models and their underlying mathematical principles has enabled the academic community to extensively analyze the performance of current image generation models and make improvements based on this stable diffusion framework. This survey aims to examine the existing issues and the current solutions pertaining to image generation models.
연구 동기 및 목표
- 확산 기반 이미지 생성에서의 주요 도전 과제(다중 객체 렌더링, 희귀 개념 및 품질)를 식별하고 이를 목표로 한 해결책을 제시한다.
- 이미지 생성에서 다루는 특정 문제별로 확산 모델을 조직한다.
- 생성 품질과 제어를 개선하는 핵심 기법, 아키텍처, 학습/추론 전략을 요약한다.
- 이전 설문과의 차이점을 이미지 생성 응용과 실용적 한계/해결책에 초점을 맞추어 강조한다.
제안 방법
- 확산 모델의 기본 원리(전방/역방 프로세스, DDPM, 그리고 classifier-free guidance (CFG))를 검토한다.
- 주의 및 교차 주의 메커니즘이 있는 노이즈 예측 U-Net의 역할과 조건 부여에서의 역할을 논의한다.
- 경계 상자, 세그멘테이션 맵 등 조건 부여 및 레이아웃 통합 방법과 ControlNet 및 변형과 같은 플러그인 아키텍처를 요약한다.
- 희귀/미지 개념 및 개인화 처리를 위한 검색 기반 및 주체 주도 생성 접근법을 설명한다.
- 텍스트 인코더 개선, 전문가 혼합, 프롬프트/샘플링 기법에 초점을 맞춘 품질 향상 전략을 개요한다.

실험 결과
연구 질문
- RQ1확산 기반 이미지 생성의 실제 한계는 무엇인가?
- RQ2다중 객체 생성을 개선하기 위해 레이아웃 및 주의 제어를 도입하는 데 어떤 기술이 존재하는가?
- RQ3검색 및 주체 주도 접근 방식이 희귀하거나 보지 못한 개념의 생성을 어떻게 돕는가?
- RQ4모델 확장을 넘어 이미지 생성 품질을 가장 효과적으로 향상시키는 전략은 무엇인가?
- RQ5다른 텍스트 인코더가 확산 기반 이미지 생성 품질에 어떤 영향을 미치는가?
주요 결과
- 레이아웃- 및 주의 기반의 방법들(예: ControlNet, GLIGEN, Attend-and-Excite)이 다중 객체 렌더링 및 레이아웃 준수를 개선한다.
- 검색 기반 및 주체 주도 접근법은 희귀/미지의 개념 생성과 개인화를 다양한 수준의 파인튜닝으로 가능하게 한다.
- 텍스트 인코더의 개선(T5-XXL, CLIP 기반 대 순수 언어 모델) 및 혼합 인코더 설정이 더 큰 U-Net 대비 품질 향상을 제공할 수 있다.
- classifier-free guidance는 주요 확산 모델 전반에 걸친 기본적 조건 부여 접근법으로 남아 있다.
- 교차 주의 맵 또는 잠재 최적화를 수정하는 기법은 광범위한 모델 재학습 없이도 이미지 품질을 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.