Skip to main content
QUICK REVIEW

[논문 리뷰] Null-text Inversion for Editing Real Images using Guided Diffusion Models

Ron Mokady, Amir Hertz|arXiv (Cornell University)|2022. 11. 17.
Generative Adversarial Networks and Image Synthesis인용 수 16
한 줄 요약

이 논문은 지도형 확산 모델을 사용하여 실사 이미지의 고해상도 텍스트 기반 편집을 위한 이중 단계 방법인 null-text inversion을 소개한다. 키포ints 역행—DDIM 유도 노이즈 경로를 기반으로 최적화하는 방식과 null-text 최적화—조건부 텍스트 임베딩을 수정하는 대신 무조건적(Null) 텍스트 임베딩만 미세조정하는 방식을 결합함으로써, 모델 미세조정 없이도 정확한 이미지 복원과 원활한 프롬프트 간 편집을 가능하게 하며, 거의 완벽한 해상도를 달성하고 편집 기능을 유지한다.

ABSTRACT

Recent text-guided diffusion models provide powerful image generation capabilities. Currently, a massive effort is given to enable the modification of these images using text only as means to offer intuitive and versatile editing. To edit a real image using these state-of-the-art tools, one must first invert the image with a meaningful text prompt into the pretrained model's domain. In this paper, we introduce an accurate inversion technique and thus facilitate an intuitive text-based modification of the image. Our proposed inversion consists of two novel key components: (i) Pivotal inversion for diffusion models. While current methods aim at mapping random noise samples to a single input image, we use a single pivotal noise vector for each timestamp and optimize around it. We demonstrate that a direct inversion is inadequate on its own, but does provide a good anchor for our optimization. (ii) NULL-text optimization, where we only modify the unconditional textual embedding that is used for classifier-free guidance, rather than the input text embedding. This allows for keeping both the model weights and the conditional embedding intact and hence enables applying prompt-based editing while avoiding the cumbersome tuning of the model's weights. Our Null-text inversion, based on the publicly available Stable Diffusion model, is extensively evaluated on a variety of images and prompt editing, showing high-fidelity editing of real images.

연구 동기 및 목표

  • 최신 수준의 텍스트-이미지 확산 모델을 활용하여 실사 이미지의 직관적인 텍스트 기반 편집을 가능하게 하기 위해.
  • 분류기 자유 지도형 확산 모델의 잠재 공간으로 실사 이미지를 역행할 때 편집 기능을 유지하는 도전 과제를 해결하기 위해.
  • 각 이미지마다 계산 비용이 큰 모델 미세조정이나 가중치 업데이트를 피할 수 있는 방법을 개발하기 위해.
  • 텍스트 가이드를 통해 실사 이미지의 고해상도 복원을 달성하고, 이후 편집 시 최소한의 왜곡을 유도하기 위해.

제안 방법

  • 핵심 역행 기법 제안: DDIM 역행을 통해 유도된 노이즈 잠재 코드의 시퀀스를 고정된 피벗으로 사용하여, 모든 노이즈 벡터를 최적화하는 대신 최적화를 수행한다.
  • null-text 최적화 도입: 조건부 텍스트 임베딩을 수정하는 대신, 입력 이미지를 더 잘 복원할 수 있도록 무조건적(Null) 텍스트 임베딩을 최적화한다.
  • 스테ble Diffusion 모델을 백본으로 사용하여, 편집 유연성을 유지하기 위해 분류기 자유 지도 메커니즘을 활용한다.
  • 분류기 자유 지도의 영향으로 발생하는 복원 오류를 수정하기 위해 DDIM 역행 경로를 중심으로 최적화를 수행한다.
  • 최적화된 null-text 임베딩을 적용하여, 역행된 이미지에서 프롬프트 간 편집을 가능하게 하며, 정체성과 구조를 유지한다.
  • 모델 가중치나 조건부 임베딩을 조정하지 않아 모델의 사전 지식이 손상되지 않으며, 효율적이고 반복 가능한 편집이 가능하다.

실험 결과

연구 질문

  • RQ1실사 이미지를 텍스트 가이드가 있는 확산 모델의 잠재 공간으로 고해상도로 역행할 수 있으며, 이 과정에서 편집 기능을 유지할 수 있는가?
  • RQ2복원 오류를 증폭시키는 분류기 자유 지도는 이미지 역행 중 어떻게 효과적으로 관리할 수 있는가?
  • RQ3단일 역행을 통해 재역행 없이 다양한 텍스트 기반 편집을 다수 수행할 수 있는가?
  • RQ4조건부 임베딩이나 모델 가중치를 최적화하는 것보다 무조건적 텍스트 임베딩만 최적화하는 것이 더 나은 복원을 이끌어내는가?
  • RQ5이 역행 방법은 정체성 충실도를 유지하면서도 프롬프트 간 편집과 같은 고급 편집 기법을 지원할 수 있는가?

주요 결과

  • Null-text inversion은 실사 이미지의 거의 완벽한 복원을 달성하며, 편집 이전에 적용했을 때 기준 SDEdit보다 LPIPS 인지 거리가 현저히 낮다.
  • 이 방법은 프롬프트 간 편집을 통해 고해상도 편집을 가능하게 하며, 복잡한 캡션 변경 조건에서도 원본 이미지의 정체성을 유지한다.
  • 무조건적 텍스트 임베딩만 최적화함으로써 모델의 사전 지식이 손상되지 않으며, 각 이미지마다 모델 미세조정이 필요 없어진다.
  • 절단 실험을 통해 핵심 역행과 null-text 최적화 모두 필수적임을 확인하였으며, 각각 복원 정확도에 크게 기여한다.
  • 목표 텍스트 일치도와 입력 충실도가 균형을 이루는 경우, 복원 오차를 줄여 SDEdit 성능을 향상시킨다.
  • 이론적으로는 이미지당 약 1분의 역행 시간이 소요되지만, 이후 각 편집은 10초 이내에 무한히 수행 가능하므로 반복적 편집에 매우 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.