Skip to main content
QUICK REVIEW

[논문 리뷰] High-Resolution Image Editing via Multi-Stage Blended Diffusion

Johannes Ackermann, Minjun Li|arXiv (Cornell University)|2022. 10. 24.
Advanced Image Processing Techniques인용 수 10
한 줄 요약

이 논문은 사전 훈련된 저해상도 확산 모델을 사용하여 고해상도 이미지 편집을 위한 다단계 혼합 확산 방법을 제안한다. 실시간 초해상도 복원기법(Real-ESRGAN)을 통해 단계적으로 해상도를 증가시키고, 중간 단계에서 Blended Diffusion를 활용해 정밀하게 보정함으로써, Repaint 및 디코더 최적화를 병행함으로써 메가픽셀 해상도에서 전역적으로 일관되고 고정밀한 편집을 달성하며, 직접 고해상도 추론 및 세그먼트 기반 편집 기준보다 뛰어난 성능을 발휘한다.

ABSTRACT

Diffusion models have shown great results in image generation and in image editing. However, current approaches are limited to low resolutions due to the computational cost of training diffusion models for high-resolution generation. We propose an approach that uses a pre-trained low-resolution diffusion model to edit images in the megapixel range. We first use Blended Diffusion to edit the image at a low resolution, and then upscale it in multiple stages, using a super-resolution model and Blended Diffusion. Using our approach, we achieve higher visual fidelity than by only applying off the shelf super-resolution methods to the output of the diffusion model. We also obtain better global consistency than directly using the diffusion model at a higher resolution.

연구 동기 및 목표

  • 사전 훈련된 확산 모델의 512×512 한계를 초월한 고해상도 이미지 편집을 가능하게 하기 위해.
  • 저해상도 확산 모델을 고해상도 이미지에 직접 적용할 경우 발생하는 전역적 불일치 및 품질 저하 문제를 해결하기 위해.
  • 대규모 편집에서 편집된 영역와 편집되지 않은 영역 간의 시각적 정밀도와 융합 품질을 향상시키기 위해.
  • 오픈소스 컴ponent와 사전 훈련된 모델만을 사용하여 메가픽셀 범위의 이미지를 실용적으로 편집할 수 있도록 하기 위해.

제안 방법

  • 사전 훈련된 확산 모델(Stable Diffusion v1.4)의 훈련 해상도에 맞게 마스크된 영역을 자르고 저해상도로 축소한다.
  • Repaint를 사용한 Blended Latent Diffusion를 적용하여 저해상도에서 국소적으로 일관된 편집을 생성하고, CLIP 유사도를 기반으로 최고의 샘플을 선택한다.
  • 실시간 초해상도 복원기법(Real-ESRGAN)을 통해 단계적으로 이미지 해상도를 증가시키고, 중간 확산 단계에서 Blended Diffusion를 재사용하여 품질을 향상시키고 프롬프트 일관성을 유지한다.
  • 편집된 영역의 해상도와 일치하도록 마스크된 영역을 저통과 필터링하여 노이즈 제거 중 블러링을 줄인다.
  • 매우 큰 출력 결과를 얻기 위해 이미지를 겹치는 격자 세그먼트로 나누고, 각 세그먼트를 별도로 처리한 후 알파 컴posit링을 통해 재조합한다.
  • 각 단계 이후에 디코더 최적화를 적용하여 편집된 영역와 원본 영역 간의 융합 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련된 저해상도 확산 모델이 고해상도 이미지 편집에 효과적으로 재사용될 수 있는가?
  • RQ2중간 단계에서 정밀 보정을 거친 다단계 해상도 증가 방식이 직접 고해상도 추론 대비 전역적 일관성과 시각적 품질을 향상시키는가?
  • RQ3Blended Diffusion와 초해상도 모델의 조합이 종단 간 고해상도 확산 또는 세그먼트 기반 편집과 비교해 어떻게 성능을 냈는가?
  • RQ4해상도 증가 과정에서 영역 일관성을 유지하는 데 가장 효과적인 사전 처리 단계(예: 저통과 필터링, Repaint)는 무엇인가?
  • RQ5매우 큰 이미지(예: 1000×2000 픽셀 이상)를 메모리 오버플로우 없이 처리할 수 있는가?

주요 결과

  • 제안된 방법은 메가픽셀 해상도에서 전역적으로 일관되고 고정밀한 편집을 달성하여, 직접 고해상도 추론에서 관찰되는 반복 패atters와 불일치 문제를 피한다.
  • Blended Diffusion와 Repaint를 조합하면 특히 복잡한 질감과 물체에서 마스크된 영역과 마스크되지 않은 영역 간의 융합 품질이 크게 향상된다.
  • 각 단계 이후에 디코더 최적화를 적용함으로써 편집된 영역와 원본 영역 간의 시각적 일관성이 향상되지만, 매우 높은 해상도에서는 계산 비용이 증가한다.
  • 직접 고해상도에서 Blended Diffusion를 적용하거나 DALL-E 2를 사용한 세그먼트 기반 편집과 비교해 본 방법이 뛰어난 성능을 발휘한다. 한 테스트 케이스에서는 DALL-E 2가 두 개의 떠 있는 조각상을 생성한 반면, 본 방법은 일관성 있는 결과를 도출했다.
  • Repaint 단계 수 R=5로 설정할 경우 다양한 이미지 유형에서 품질과 일관성 간 균형을 잘 유지할 수 있으나, 최적 설정은 입력에 따라 다를 수 있다.
  • Real-ESRGAN을 통한 해상도 증가는 일반적으로 잘 작동하지만, 세밀한 디테일를 제거하여 일부 경우에서 융합 아티팩트를 유발할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.