Skip to main content
QUICK REVIEW

[논문 리뷰] Paint by Example: Exemplar-based Image Editing with Diffusion Models

Binxin Yang, Shuyang Gu|arXiv (Cornell University)|2022. 11. 23.
Generative Adversarial Networks and Image Synthesis인용 수 8
한 줄 요약

이 논문은 자기지도 학습, 정보 차단 기법, 강력한 데이터 증강 및 분류기 자유 가이던스를 활용하여 복사-붙여넣기 아티팩트를 방지하고 단일 전방 추론을 통해 최신 기술 수준의 성능을 달성하는, 확산 모델을 활용한 새로운 예시 기반 이미지 편집 프레임워크를 제안한다. 이는 참조 예시 이미지를 통해 정교하고 고해상도의 의미적 조작을 가능하게 한다.

ABSTRACT

Language-guided image editing has achieved great success recently. In this paper, for the first time, we investigate exemplar-guided image editing for more precise control. We achieve this goal by leveraging self-supervised training to disentangle and re-organize the source image and the exemplar. However, the naive approach will cause obvious fusing artifacts. We carefully analyze it and propose an information bottleneck and strong augmentations to avoid the trivial solution of directly copying and pasting the exemplar image. Meanwhile, to ensure the controllability of the editing process, we design an arbitrary shape mask for the exemplar image and leverage the classifier-free guidance to increase the similarity to the exemplar image. The whole framework involves a single forward of the diffusion model without any iterative optimization. We demonstrate that our method achieves an impressive performance and enables controllable editing on in-the-wild images with high fidelity.

연구 동기 및 목표

  • 언어로 기술하기 어려운 세밀한 시각적 세부 사항을 포착하지 못하는 텍스트 기반 이미지 편집의 한계를 해결하기 위해.
  • 사용자가 참조로 사용할 예시 이미지를 제공할 수 있도록 직관적이고 사용자 友好的한 이미지 편집을 가능하게 하기 위해.
  • 자기지도 학습에서 직접 복사-붙여넣기와 같은 단순한 해결책을 피하기 위해 구조적 및 의미적 제약 조건을 도입하기 위해.
  • 반복 최적화 없이 단일 전방 추론을 통해 고품질, 다양한 결과물 및 제어 가능한 이미지 편집을 달성하기 위해.

제안 방법

  • 모델는 소스 이미지와 예시 이미지를 조건으로 하는 확산 모델을 사용하며, 자르기된 영역을 참조로 하여 자기지도 학습 방식으로 훈련된다.
  • 예시 이미지를 전역 임베딩으로 압축함으로써 정보 차단 기법을 적용하여, 공간적 세부 사항을 기억하지 못하게 하고 복사-붙여넣기 아티팩트를 방지한다.
  • 훈련 중에 예시 이미지에 강력한 데이터 증강을 적용하여 훈련과 추론 간 도메인 갭을 줄인다.
  • 훈련 중에 임의의 형태의 마스크를 사용하여 실제 사용자의 브러시 스토리지 효과를 시뮬레이션하고, 비정규적인 편집 영역으로의 일반화 능력을 향상시킨다.
  • 생성된 영역과 예시 이미지 간 유사도를 향상시켜 스타일 및 콘텐츠 충실도를 높이기 위해 분류기 자유 가이던스를 통합한다.
  • 모든 편집 과정은 단일 전방 추론으로 수행되어 반복 최적화 없이 실시간 추론이 가능하다.

실험 결과

연구 질문

  • RQ1세밀한 이미지 조작에 있어 예시 기반 편집이 텍스트 기반 방법보다 더 높은 충실도와 제어 가능성 달성할 수 있는가?
  • RQ2예시 기반 편집에서 단순한 복사-붙여넣기 해결책을 피하기 위해 어떻게 자기지도 학습을 설계할 수 있는가?
  • RQ3정보 차단 기법이 확산 모델에서 의미 이해와 공간 기억을 분리하는 데 어떤 역할을 하는가?
  • RQ4강력한 데이터 증강과 분류기 자유 가이던스가 예시 기반 편집에서 일반화 능력과 시각적 품질 향상에 얼마나 기여하는가?
  • RQ5반복 최적화 기반 방법과 비교해 복수의 추론 단계 없이도 단일 전방 추론 과정이 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 모든 변형 중에서 가장 낮은 FID 점수(1.79)와 가장 높은 CLIP 점수(84.97)를 기록하여 이미지 품질과 참조 유사도 측면에서 뛰어난 성능을 입증한다.
  • 절단 실험 결과, 사전 지식, 증강, 정보 차단, 분류기 자유 가이던스를 모두 조합할 경우 최고의 성능을 달성하며, FID는 기준 모델의 3.61에서 3.18로 감소한다.
  • 분류기 자유 가이던스는 시각적 품질과 참조 유사도를 크게 향상시키며, 스케일 값이 높을수록($\lambda = 5$) 예시에 더 가까운 결과를 생성한다.
  • 확산 모델의 확률적 성격 덕분에 동일한 소스 이미지와 예시 이미지로부터 다양한 실사적인 출력물을 생성할 수 있으며, 털 색상, 귀 모양 등의 핵심 정체성 특성은 유지된다.
  • 이미지 품질과 일관성 측면에서 기존 방법들을 능가하며, 기준 모델 대비 FID 점수는 44% 감소하고 CLIP 점수는 25% 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.