Skip to main content
QUICK REVIEW

[논문 리뷰] Generative AI in Vision: A Survey on Models, Metrics and Applications

Gaurav Raut, Apoorv Singh|arXiv (Cornell University)|2024. 02. 26.
Retinal Imaging and AnalysisMedicine인용 수 3
한 줄 요약

이 종합적 서베이는 컴퓨터 시각 분야의 확산 및 전통적인 생성 모델에 대한 포괄적인 개요를 제공하며, 이론적 기초, 최신 아키텍처, 그리고 텍스트에서 이미지 생성, 이미지 보간, 초해상도 등 다양한 응용 분야를 상세히 다룬다. 특히 노이즈 제거 확산 확률 모델(DDPM), 스코어 기반 모델링, 잠재 확산 분야의 주요 진전을 강조하면서 확산 모델의 확장성, 해석 가능성, 윤리적 AI와 관련된 핵심 과제와 향후 연구 방향을 밝힌다.

ABSTRACT

Generative AI models have revolutionized various fields by enabling the creation of realistic and diverse data samples. Among these models, diffusion models have emerged as a powerful approach for generating high-quality images, text, and audio. This survey paper provides a comprehensive overview of generative AI diffusion and legacy models, focusing on their underlying techniques, applications across different domains, and their challenges. We delve into the theoretical foundations of diffusion models, including concepts such as denoising diffusion probabilistic models (DDPM) and score-based generative modeling. Furthermore, we explore the diverse applications of these models in text-to-image, image inpainting, and image super-resolution, along with others, showcasing their potential in creative tasks and data augmentation. By synthesizing existing research and highlighting critical advancements in this field, this survey aims to provide researchers and practitioners with a comprehensive understanding of generative AI diffusion and legacy models and inspire future innovations in this exciting area of artificial intelligence.

연구 동기 및 목표

  • 컴퓨터 시각 분야의 생성형 AI 모델, 특히 확산 및 전통적 아키텍처에 중점을 두고 체계적인 리뷰를 제공하기.
  • DDPM 및 스코어 기반 생성 모델링을 포함한 확산 모델의 이론적 기초 분석하기.
  • 텍스트에서 이미지 합성, 이미지 보간, 초해상도, 이상 탐지 등 최신 응용 분야 서베이하기.
  • 확산 모델의 학습 안정성, 확장성, 해석 가능성과 관련된 주요 과제 식별하기.
  • 미래 연구 방향 개선을 위한 시간 시리즈 예측, 물리 기반 모델링, 윤리적 고려 사항 등 제시하기.

제안 방법

  • VAE, GAN, 정규화 흐름, 에너지 기반 모델을 포함한 기본 생성 모델 서베이하기.
  • DDPM에서의 전진 및 역방향 확산 과정 상세 기술: 노이즈를 점차적으로 추가하고, 학습된 노이즈 제거를 통해 복원하기.
  • 전진 과정에서 마르코프 체인의 사용 설명: $ x_t = \sqrt{1-\beta_t}x_{t-1} + \sqrt{\beta_t}\epsilon $, 여기서 $ \epsilon \sim \mathcal{N}(0, I) $.
  • 역방향 확산 커널(RDK)을 신경망으로 정의하여 각 단계에서 노이즈를 예측하고 데이터 복원하기.
  • 텍스트나 마스킹된 이미지 조건부를 사용하는 조건부 확산 모델인 Stable Diffusion 및 Palette의 분석.
  • 단순체 노이즈 편향을 사용한 DDPM 기반 복원을 통한 이상 탐지에 활용된 AnoDDPM과 같은 전문화된 응용 분석.
Figure 1 : a) Images generated using stable diffusion [ 70 ] ; b) Image super-resolution results from SR3 [ 72 ] ; c) Image inpainting results from Palette [ 73 ]
Figure 1 : a) Images generated using stable diffusion [ 70 ] ; b) Image super-resolution results from SR3 [ 72 ] ; c) Image inpainting results from Palette [ 73 ]

실험 결과

연구 질문

  • RQ1DDPM 및 스코어 기반 모델은 GAN과 VAE에 비해 어떻게 고해상도 이미지 생성을 달성하는가?
  • RQ2텍스트에서 이미지 생성 및 이미지 보간 작업에서 최고 성능을 내기 위한 주요 아키텍처 및 학습 혁신은 무엇인가?
  • RQ3확산 모델은 이미지 초해상도, 색상화, 이상 탐지와 같은 후행 작업에 어떻게 적응시킬 수 있는가?
  • RQ4학습 안정성, 추론 속도, 해석 가능성 측면에서 현재 확산 모델의 주요 한계는 무엇인가?
  • RQ5시간 시리즈 예측, 물리 기반 모델링, 윤리적 고려 사항 등 미래 연구 방향 중 확산 기반 생성형 AI 발전에 가장 기여할 만한 분야는 무엇인가?

주요 결과

  • 특히 DDPM 및 잠재 확산 모델은 점차 노이즈를 추가하는 과정을 뒤집어 데이터를 복원함으로써 고품질 이미지 생성을 달성한다.
  • Palette 및 RePaint과 같은 조건부 확산 모델은 마르코프 체인 성질을 활용해 마스킹된 영역만 노이즈 제거함으로써 고해상도 이미지 보간을 가능하게 한다.
  • AnoDDPM은 건강한 이미지의 복원을 위해 DDPM을 학습하고, 변형된 테스트 샘플에서 복원 오차를 측정함으로써 이상 탐지를 달성한다.
  • Stable Diffusion와 같은 잠재 확산 모델은 압축된 잠재 공간에서 작동함으로써 효율성을 크게 향상시킨다.
  • 강력한 성능에도 불구하고 확산 모델은 학습 안정성, 계산 비용, 해석 가능성 측면에서 과제를 안고 있다.
  • 미래 연구는 시간 시리즈 예측, 물리 기반 모델링, 편향 및 사회적 영향과 같은 윤리적 문제 해결에 초점을 맞출 필요가 있다.
Figure 2 : An extension of generative models classification based on [ 25 ]
Figure 2 : An extension of generative models classification based on [ 25 ]

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.