Skip to main content
QUICK REVIEW

[논문 리뷰] In-Domain GAN Inversion for Real Image Editing

Jiapeng Zhu, Yujun Shen|arXiv (Cornell University)|2020. 03. 31.
Generative Adversarial Networks and Image Synthesis참고 문헌 55인용 수 8
한 줄 요약

이 논문은 사전 훈련된 GAN의 잠재 공간 내에 위치하는 의미론적 도메인에 맞는 잠재 코드를 보장하기 위해 도메인 가이드드 인코더를 훈련하고 최적화 과정에서 정규화 기법으로 사용하는 도메인 내 GAN 역행렬 방법을 제안한다. 이 방법은 픽셀 수준의 재구성 성능뿐 아니라 의미론적 편집 성능을 모두 향상시켜 얼굴 편집, 보간, 의미론적 확산 작업에서 최신 기술들을 크게 능가한다.

ABSTRACT

Recent work has shown that a variety of semantics emerge in the latent space of Generative Adversarial Networks (GANs) when being trained to synthesize images. However, it is difficult to use these learned semantics for real image editing. A common practice of feeding a real image to a trained GAN generator is to invert it back to a latent code. However, existing inversion methods typically focus on reconstructing the target image by pixel values yet fail to land the inverted code in the semantic domain of the original latent space. As a result, the reconstructed image cannot well support semantic editing through varying the inverted code. To solve this problem, we propose an in-domain GAN inversion approach, which not only faithfully reconstructs the input image but also ensures the inverted code to be semantically meaningful for editing. We first learn a novel domain-guided encoder to project a given image to the native latent space of GANs. We then propose domain-regularized optimization by involving the encoder as a regularizer to fine-tune the code produced by the encoder and better recover the target image. Extensive experiments suggest that our inversion method achieves satisfying real image reconstruction and more importantly facilitates various image editing tasks, significantly outperforming start-of-the-arts.

연구 동기 및 목표

  • 기존 GAN 역행렬 방법이 역행렬된 코드의 의미론적 의미성보다 픽셀 수준 재구성 성능을 우선시하는 한계를 해결하기 위해.
  • 역행렬된 잠재 코드가 원래 GAN의 잠재 공간의 의미론적 도메인 내에 위치하도록 보장하기 위해.
  • 의미론적으로 정렬된 잠재 코드를 재사용함으로써 다양한 실사 편집을 가능하게 하기 위해.
  • 도메인 내 코드가 픽셀 최적화된 코드보다 더 나은 이미지 조작 성능을 보이는지 조사하기 위해.
  • 고정밀 재구성과 잠재 공간 내 의미 일致성을 균형 잡는 방법을 개발하기 위해.

제안 방법

  • 사전 훈련된 GAN의 잠재 공간으로 실사 이미지를 매핑하기 위해 도메인 가이드드 인코더를 훈련하여 모든 인코딩된 코드가 도메인 내에 있도록 보장한다.
  • 훈련된 인코더를 정규화 기법으로 통합하여 도메인 정규화 최적화를 수행함으로써 역행렬된 코드를 개선한다.
  • 최적화 목표는 픽셀 수준 재구성 손실과 역행렬된 코드가 인코더 출력과 일치하도록 유도하는 도메인 정규화 항을 조합한다.
  • 이 방법은 MSE 손실과 도메인 정규화의 가중 조합을 사용하며, 하이퍼파ram터 λdom이 재구성과 의미론적 정밀도 사이의 트레이드오프를 제어한다.
  • 모든 이미지에 대해 인스턴스 수준 최적화를 통해 적용하여 GAN의 미세조정 없이도 고품질의 역행렬을 달성한다.
  • 이 프레임워크는 속성 조작, 선형 보간, 의미론적 확산과 같은 다양한 편집 작업을 지원한다.

실험 결과

연구 질문

  • RQ1GAN 역행렬이 픽셀 수준 재구성뿐 아니라 의미론적으로도 의미 있는 잠재 코드를 생성할 수 있는가?
  • RQ2원래 GAN의 잠재 공간에 역행렬된 코드를 일치시키는 것이 후속 이미지 편집 능력을 향상시키는가?
  • RQ3학습된 인코더를 통한 도메인 정규화가 재구성 품질과 의미론적 일치성 사이의 트레이드오프에 어떤 영향을 미치는가?
  • RQ4한 개의 사전 훈련된 GAN 모델이 얼굴, 동물, 경관 등 다양한 이미지 도메인의 편집을 도메인 내 역행렬을 통해 지원할 수 있는가?
  • RQ5의미론적 편집 작업(예: 속성 전이, 의미론적 확산)에서 도메인 내 역행렬이 표준 최적화 기반의 역행렬보다 우수한가?

주요 결과

  • 제안된 도메인 내 역행렬 방법은 픽셀 정확도와 의미론적 정밀도를 균형 잡는 데 있어 최신 기술들보다 뛰어난 이미지 재구성 품질을 달성한다.
  • 이 방법은 안경 추가와 같은 속성 조작과 같은 고품질 의미론적 편집을 가능하게 하여 기준 방법들보다 더 자연스럽고 일관된 결과를 도출한다.
  • 역행렬된 코드 간 선형 보간은 더 부드럽고 의미론적으로 더 일관된 전환을 만들어내어 개선된 잠재 공간 구조를 보여준다.
  • 의미론적 확산 결과에서는, 이 방법이 정체성을 잘 유지하면서도 목표 얼굴를 다양한 맥락에 자연스럽게 통합함으로써 현실감과 호환성을 유지하는 데 성공했다.
  • 단절 실험 결과는 도메인 정규화 가중치(λdom)를 증가시킬수록 의미론적 편집 성능이 향상되지만 약간의 재구성 품질 저하가 수반됨을 확인하여 트레이드오프 설계의 타당성을 입증한다.
  • 이 방법은 도메인 간 일반화 성능이 뛰어나며, 얼굴 합성 GAN을 사용할 때도 침실이나 고양이 얼굴과 같은 도메인 외 이미지에 대해서도 의미론적으로 의미 있는 코드를 생성한다. 반면 기준 방법들은 구조적 의미론을 유지하지 못하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.