[논문 리뷰] Diffusion Models in Vision: A Survey
이 종합 검토는 컴퓨터 시각 분야의 노이즈 제거 확산 모델에 대한 포괄적인 개요를 제공하며, 세 가지 핵심 공식화 방식—DDPMs, NCSNs, SDEs—와 이미지 생성, 초해상도, 이미지 보간, 판별적 과제 등 응용 사례를 다룹니다. 계산적 비효율성에도 불구하고 이 모델들은 최신 기술 수준의 샘플 품질과 다양성을 달성하고 있으며, 효율적인 샘플링, 다중 작업 학습, 영상 생성 등의 향후 연구 방향을 제시합니다.
Denoising diffusion models represent a recent emerging topic in computer vision, demonstrating remarkable results in the area of generative modeling. A diffusion model is a deep generative model that is based on two stages, a forward diffusion stage and a reverse diffusion stage. In the forward diffusion stage, the input data is gradually perturbed over several steps by adding Gaussian noise. In the reverse stage, a model is tasked at recovering the original input data by learning to gradually reverse the diffusion process, step by step. Diffusion models are widely appreciated for the quality and diversity of the generated samples, despite their known computational burdens, i.e. low speeds due to the high number of steps involved during sampling. In this survey, we provide a comprehensive review of articles on denoising diffusion models applied in vision, comprising both theoretical and practical contributions in the field. First, we identify and present three generic diffusion modeling frameworks, which are based on denoising diffusion probabilistic models, noise conditioned score networks, and stochastic differential equations. We further discuss the relations between diffusion models and other deep generative models, including variational auto-encoders, generative adversarial networks, energy-based models, autoregressive models and normalizing flows. Then, we introduce a multi-perspective categorization of diffusion models applied in computer vision. Finally, we illustrate the current limitations of diffusion models and envision some interesting directions for future research.
연구 동기 및 목표
- 노이즈 제거 확산 모델의 이론적 기초와 실용적 응용을 포함하여 컴퓨터 시각 분야에서의 확산 모델에 대한 체계적인 검토를 제공하는 것.
- 세 가지 주요 공식화 방식인 노이즈 제거 확산 확률 모델(Den lattering Diffusion Probabilistic Models, DDPMs), 노이즈 조절 스코어 네트워크(Noise Conditioned Score Networks, NCSNs), 및 확률적 미분 방정식(Stochastic Differential Equations, SDEs)을 식별하고 비교하는 것.
- VAEs, GANs, 정규화 흐름, 자동재귀 모델 등 다른 딥 러닝 생성 모델과의 관계를 분석하는 것.
- 다중 시각적 틀을 통해 컴퓨터 시각 분야에서의 기존 확산 모델 응용 사례를 분류하는 것.
- 특히 추론 속도와 텍스트 조건화 문제와 같은 현재의 한계점을 규명하고 향후 연구 방향을 제안하는 것.
제안 방법
- 확산 모델을 세 가지 주요 이론적 프레임워크로 분류: DDPMs, NCSNs, SDEs로, 그들의 수학적 공식화와 상호 관계를 강조.
- 전방 확산 과정을 시간 단계에 걸쳐 반복적으로 가우시안 노이즈를 추가하는 방식으로 표현하여 데이터를 순수한 노이즈로 변환.
- 역방향 확산 과정을 학습된 노이즈 제거 과정으로 설명하며, 신경망이 단계적으로 노이즈를 예측하고 제거하여 데이터를 재구성하는 방식을 설명.
- SDEs를 통합 프레임워크로 사용하여, 특정 드리프트 및 확산 함수의 선택에 따라 DDPMs와 NCSNs가 특수한 경우로 나타남을 보여줌.
- VAEs의 가능도 최대화 원리나 GANs의 적대적 훈련 원리를 분석하여 다른 생성 모델과의 비교를 수행.
- 조건부 생성, 이미지 편집, 판별 과제를 위한 표현 학습 등 다양한 시각적 응용 사례를 다중 시각적 틀로 분류.
실험 결과
연구 질문
- RQ1세 가지 주요 공식화 방식인 DDPMs, NCSNs, SDEs는 그 수학적 구조와 실용적 구현에서 어떻게 다릅니까?
- RQ2GANs나 VAEs와 같은 다른 딥 러닝 생성 모델에 비해 확산 모델이 가지는 주요 이론적 및 실용적 이점은 무엇입니까?
- RQ3확산 모델은 어떤 컴퓨터 시각 과제에서 뛰어난 성능을 보였으며, 분포 외부 또는 복잡한 프롬프트에 대해 어떻게 일반화합니까?
- RQ4현재 확산 모델의 주요 한계점은 무엇이며, 특히 추론 속도와 텍스트 조건화 문제는 어떠한가요?
- RQ5확산 모델의 효율성, 다양성, 일반화 능력을 향상시키기 위한 향후 연구 방향은 무엇입니까?
주요 결과
- 확산 모델은 이미지 생성 분야에서 최신 기술 수준의 샘플 품질과 다양성을 달성하며, Stable Diffusion와 같은 모델은 비현실적인 시나리오조차도 매우 세밀하고 프롬프트에 맞는 이미지를 생성합니다.
- 확산 모델의 역방향 노이즈 제거 과정은 각 단계에서 스코어 기반 또는 노이즈 제거 기반 예측을 사용하여 점진적으로 데이터를 노이즈에서 재구성합니다.
- 잠재 확산 모델(Latent Diffusion Models, LDMs)의 변종인 Stable Diffusion는 미리 보지 않은 텍스트 프롬프트에 대해 강력한 제로샷 일반화 능력을 보이며, 강력한 조건부 생성 능력을 시사합니다.
- 높은 샘플 품질에도 불구하고, 확산 모델은 많은 추론 단계(예: 50–1000단계)를 요구하여 GANs보다 훨씬 느리며, 실시간 생성에는 여전히 GANs가 더 빠릅니다.
- 텍스트 조건화에 사용되는 CLIP 임베딩은 철자나 언어적 제약을 그대로 물려받아 생성된 이미지 내에서 가독성이 없는 텍스트를 생성하는 데 실패할 수 있습니다.
- 확산 모델에서 유도된 잠재 표현은 이미지 세그멘테이션, 분류, 이상 탐지와 같은 판별 과제에서 유용하게 기능하며, 강력한 특징 학습 능력을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.