Skip to main content
QUICK REVIEW

[논문 리뷰] SinDDM: A Single Image Denoising Diffusion Model

В. А. Куликов, Shahar Yadin|arXiv (Cornell University)|2022. 11. 29.
Generative Adversarial Networks and Image Synthesis인용 수 9
한 줄 요약

SinDDM는 단일 이미지에서 다중 척도 확산 과정과 노이즈 수준 및 척도에 조건부로 작동하는 경량 전연결 합성곱 노이즈 제거기(denoiser)를 활용해 단일 이미지에서 훈련하는 단일 이미지 노이즈 제거 확산 모델을 제안한다. 이는 재학습이나 아키텍처 변경 없이도 임의의 해상도에서 고품질이고 다양한 이미지 생성을 가능하게 하며, CLIP를 통한 텍스트 가이드 편집도 지원한다.

ABSTRACT

Denoising diffusion models (DDMs) have led to staggering performance leaps in image generation, editing and restoration. However, existing DDMs use very large datasets for training. Here, we introduce a framework for training a DDM on a single image. Our method, which we coin SinDDM, learns the internal statistics of the training image by using a multi-scale diffusion process. To drive the reverse diffusion process, we use a fully-convolutional light-weight denoiser, which is conditioned on both the noise level and the scale. This architecture allows generating samples of arbitrary dimensions, in a coarse-to-fine manner. As we illustrate, SinDDM generates diverse high-quality samples, and is applicable in a wide array of tasks, including style transfer and harmonization. Furthermore, it can be easily guided by external supervision. Particularly, we demonstrate text-guided generation from a single image using a pre-trained CLIP model.

연구 동기 및 목표

  • 대규모 데이터셋이 필요 없이 단일 이미지에서 학습하는 생성 모델을 개발하는 것.
  • 다중 척도 내부 통계를 활용해 단일 이미지에서 훈련함으로써 확산 모델의 데이터 부족 문제를 해결하는 것.
  • 거칠기에서부터 정밀해지는 샘플링을 통해 임의의 해상도에서 다양하고 고해상도의 이미지 생성을 가능하게 하는 것.
  • 재학습 없이 사전 훈련된 모델을 사용해 텍스트 기반 콘텐츠 및 스타일 편집과 같은 융통성 있는 이미지 조작을 지원하는 것.
  • 원본 이미지의 구조적 및 질감 일관성을 유지하면서도 표본의 다양성과 현실감을 유지하는 것.

제안 방법

  • 각 척도에서 원본 훈련 이미지의 다운샘플링 및 블러링된 버전을 사용해 다중 척도 전방 확산 과정을 구성한다.
  • 노이즈 수준과 척도에 조건부로 작동하는 경량 전연결 합성곱 노이즈 제거기를 각 척도에서 확산 과정을 역행하도록 훈련한다.
  • 역행 과정은 거칠기에서부터 정밀해지는 방식으로 진행되며, 가장 거친 척도에서 노이즈가 점차 제거되고, 그 다음 더 정밀한 척도로 업샘플링되고 노이즈와 재결합된다.
  • 노이즈 제거기는 작은 수신장(receptive field)을 사용해 세밀한 국소 통계를 모델링함으로써 현실적인 질감 및 소형 구조의 합성에 기여한다.
  • 모델 아키텍처를 수정하지 않고도 사전 훈련된 CLIP 모델을 사용해 특징 기반 손실을 통해 샘플링 과정을 가이드함으로써 텍스트 기반 생성을 달성한다.
  • 샘플링 다양성은 팯딩 전략에 의해 영향을 받으며, 계층별 제로 팼딩은 경계 변동성을 감소시키고, 초기 입력 팼딩은 이를 증가시킨다.

실험 결과

연구 질문

  • RQ1내부 이미지 통계만을 사용해 단일 이미지에서 효과적으로 노이즈 제거 확산 모델을 훈련시킬 수 있는가?
  • RQ2다중 척도 아키텍처를 통해 단일 이미지에서 임의의 해상도에서 다양하고 고품질의 샘플을 생성할 수 있는가?
  • RQ3재학습 없이 단일 이미지 기반 확산 모델이 텍스트 기반 이미지 생성을 얼마나 잘 지원할 수 있는가?
  • RQ4다중 척도 아키텍처가 생성 샘플의 전반적인 구조와 세부 묘사 모두를 유지하는 데 어떤 기여를 하는가?
  • RQ5훈련 이미지에 드물게 나타나거나 부족하게 표현된 객체를 표현하는 데에는 어떤 한계가 있으며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • SinDDM는 원본 이미지에 존재하지 않는 대규모 구조나 세부 묶음의 새로운 조합까지 포함해 임의의 해상도에서 다양하고 고해상도의 샘플을 생성한다.
  • CLIP를 사용해 재학습이나 아키텍처 변경 없이도 텍스트 기반 이미지 생성을 성공적으로 수행하며, 콘텐츠 및 스타일 편집이 가능하다.
  • 스타일 전이 및 조화 작업에서 SinIR 및 ConSinGAN보다 우수한 성능을 보이며, 더 일관되고 자연스럽게 통합된 결과를 생성한다.
  • 원본 이미지에 존재하지 않는 새로운 스카이라인 배열이나 산의 각도 등 실제 변형된 이미지의 현실적인 변형을 생성할 수 있다.
  • 일부 객체(예: 코끼리 또는 새)의 과대 또는 과소 표현 등의 한계가 있으며, 이는 초기 타임스텝 수동 조정을 통해 완화될 수 있지만 아직 자동화되지 않았다.
  • 팻딩 설정은 이미지 경계에서의 샘플링 다양성에 크게 영향을 미치며, 계층별 제로 팼딩은 경계 변동성을 감소시키고, 입력 전용 팼딩은 이를 증가시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.