Skip to main content
QUICK REVIEW

[논문 리뷰] Real-World Image Variation by Aligning Diffusion Inversion Chain

Yuechen Zhang, Jinbo Xing|arXiv (Cornell University)|2023. 05. 30.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 확산 모델의 노이즈 제거 체인을 소스 이미지의 역행 체인 잠재 분포와 정렬함으로써 훈련 없이 고성능의 실세계 이미지 변형을 생성하는 RIVAL이라는 추론 파이프라인을 제안한다. 교차 이미지 자기주의 주입과 단계별 잠재 정규화를 도입함으로써 RIVAL은 도메인 갭을 감소시키고 기존 방법에 비해 향상된 인지적 품질과 의미 일致성을 달성한다.

ABSTRACT

Recent diffusion model advancements have enabled high-fidelity images to be generated using text prompts. However, a domain gap exists between generated images and real-world images, which poses a challenge in generating high-quality variations of real-world images. Our investigation uncovers that this domain gap originates from a latents' distribution gap in different diffusion processes. To address this issue, we propose a novel inference pipeline called Real-world Image Variation by ALignment (RIVAL) that utilizes diffusion models to generate image variations from a single image exemplar. Our pipeline enhances the generation quality of image variations by aligning the image generation process to the source image's inversion chain. Specifically, we demonstrate that step-wise latent distribution alignment is essential for generating high-quality variations. To attain this, we design a cross-image self-attention injection for feature interaction and a step-wise distribution normalization to align the latent features. Incorporating these alignment processes into a diffusion model allows RIVAL to generate high-quality image variations without further parameter optimization. Our experimental results demonstrate that our proposed approach outperforms existing methods concerning semantic similarity and perceptual quality. This generalized inference pipeline can be easily applied to other diffusion-based generation tasks, such as image-conditioned text-to-image generation and stylization.

연구 동기 및 목표

  • 확산 기반 이미지 변형 생성에서 생성된 이미지와 실세계 이미지 간의 도메인 갭을 해결하기 위해.
  • 추가적인 훈련이나 파rameter 최적화 없이도 이미지 변형의 의미적 및 인지적 품질을 향상시키기 위해.
  • 텍스트 프롬프트를 의미적 가이드로 사용하여 단일 이미지 예시로부터 고품질의 이미지 생성을 가능하게 하기 위해.
  • 다양한 텍스트-이미지 생성 작업에 적용 가능한 일반화된 추론 파이프라인을 개발하기 위해.

제안 방법

  • 실사 이미지의 역행 체인과 확산 모델의 노이즈 제거 체인을 정렬하는 훈련 없이 작동하는 추론 파이프라인인 RIVAL을 제안한다.
  • 노이즈 제거 과정 중 생성된 이미지와 소스 이미지의 은닉 상태 간의 특징 상호작용을 가능하게 하기 위해 교차 이미지 자기주의 주입을 도입한다.
  • 생성 체인의 잠재 분포를 소스 이미지의 역행 잠재 분포와 정렬하기 위해 단계별 잠재 정규화를 적용한다.
  • 주의 메커니즘 내에서 참조 특징의 조기 융합을 통해 스타일과 콘텐츠 일致성을 유지한다.
  • 의미적 정밀도를 유지하면서도 텍스트 조건부 하에서 다양한 변형을 가능하게 하는 수정된 노이즈 제거 과정을 활용한다.
  • 세부 조정 없이 사전 훈련된 DDPM을 활용하여 다양한 생성 작업에 즉시 적용 가능한 플러그 앤 플레이 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1확산 기반 이미지 변형 생성에서 생성된 이미지와 실세계 이미지 간의 도메인 갭을 어떻게 줄일 수 있는가?
  • RQ2확산 샘플링 과정에서 잠재 분포의 불일치가 이미지 품질 저하에 어떤 영향을 미치는가?
  • RQ3모델의 미세조정 없이도 교차 이미지 주의와 단계별 정규화가 잠재 분포를 효과적으로 정렬할 수 있는가?
  • RQ4제안된 정렬 방식이 이미지 변형의 인지적 품질과 의미 일치성에 어떻게 기여하는가?
  • RQ5RIVAL 파이프라인은 다른 텍스트-이미지 생성 작업에 얼마나 일반화될 수 있는가?

주요 결과

  • RIVAL는 DDPM 및 텍스트 조건부 확산과 같은 기준 방법에 비해 이미지 변형의 인지적 품질과 의미 유사도를 크게 향상시킨다.
  • 추가 훈련이나 최적화 없이도 이미지 변형 생성 분야에서 최신 기술 수준의 성능을 달성한다.
  • 단계별 잠재 정규화가 생성 체인과 역행 체인 간의 분포 발산을 효과적으로 감소시켜 도메인 갭을 최소화한다.
  • 교차 이미지 자기주의 주입이 특징 상호작용을 향상시켜 생성된 이미지의 스타일과 콘텐츠 유지 능력을 강화한다.
  • 소스 예시의 톤, 스타일, 콘텐츠를 유지하면서도 텍스트 프롬프트 기반 고품질 이미지 생성을 가능하게 한다.
  • RIVAL는 DreamBooth와 같은 개념 커스터마이제이션 기법과 호환되어 실세계 이미지 일관성을 유지하는 새로운 개념의 생성을 원활하게 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.