Skip to main content
QUICK REVIEW

[논문 리뷰] Near Perfect GAN Inversion

Qianli Feng, Viraj Shah|arXiv (Cornell University)|2022. 02. 23.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 고정된 인코더나 최적화 기반 잠복 코드 검색에 의존하지 않고 생성망 $G(\cdot)$ 를 국소적으로 미세조정하여 실사 이미지의 거의 완벽한 복원을 달성하는 새로운 GAN 역전이 방법을 제안한다. 이 방법은 최신 기법들에 비해 평균 제곱오차(MSE)를 한 단계 낮추며, 표준 GAN 편집 기법을 통해 완전히 편집 가능한, 구분이 불가능한 클론 이미지를 생성한다.

ABSTRACT

To edit a real photo using Generative Adversarial Networks (GANs), we need a GAN inversion algorithm to identify the latent vector that perfectly reproduces it. Unfortunately, whereas existing inversion algorithms can synthesize images similar to real photos, they cannot generate the identical clones needed in most applications. Here, we derive an algorithm that achieves near perfect reconstructions of photos. Rather than relying on encoder- or optimization-based methods to find an inverse mapping on a fixed generator $G(\cdot)$, we derive an approach to locally adjust $G(\cdot)$ to more optimally represent the photos we wish to synthesize. This is done by locally tweaking the learned mapping $G(\cdot)$ s.t. $\| {\bf x} - G({\bf z}) \| 0$ a small scalar. We show that this approach can not only produce synthetic images that are indistinguishable from the real photos we wish to replicate, but that these images are readily editable. We demonstrate the effectiveness of the derived algorithm on a variety of datasets including human faces, animals, and cars, and discuss its importance for diversity and inclusion.

연구 동기 및 목표

  • 기존 방법이 고정된 생성망 용량으로 인해 실사 사진의 정확한 클론을 생성하지 못하는 기초적 한계를 해결하기 위해.
  • 재구성된 이미지가 단순히 유사할 뿐 아니라 정확히 동일한 클론임을 보장함으로써 실사 이미지의 의미적 편집을 가능하게 하기 위해.
  • 표준 방법에서 자주 잘못 재구성되는 소수집단의 이미지를 위해 신뢰할 수 있는 역전이를 가능하게 하여 공정성과 포용성을 향상시키기 위해.
  • 전체 GAN을 재학습하지 않고도 거의 완벽한 재현을 달성하면서 계산 오버헤드를 최소화하기 위해.

제안 방법

  • 이 방법은 목표 실사 이미지 $\mathbf{x}$ 와 잠복 코드 $\mathbf{z}$ 를 사용해 $\|\mathbf{x} - G(\mathbf{z})\| < \epsilon$ 를 최소화하도록 생성망 $G(\cdot)$ 를 국소적으로 조정한다. 여기서 $\epsilon$ 는 작은 임계값이다.
  • 인코더 $h(\cdot)$ 를 최적화하거나 학습하는 대신, 목표 이미지를 더 잘 재구성할 수 있도록 잠복 코드 $\mathbf{z}$ 근처의 생성망 가중치를 업데이트한다.
  • 국소 업데이트는 생성망 파arameter에 대해 기울기 기반 최적화를 통해 수행되며, 원래 GAN의 구조와 스타일 전이 능력을 유지한다.
  • 고정밀 재구성의 평가를 위해 인지적 손실(LPIPS)과 MSE 를 평가 지표로 사용한다.
  • 이 방법은 StyleSpace 및 비지도 편집 기법과 같은 표준 GAN 편집 도구와 호환된다.
  • 생성망의 미세조정은 경량이며, 이미지당 몇 분에서 수십 분 내외로 전체 재학습이 아닌 단순한 조정으로 이루어진다.

실험 결과

연구 질문

  • RQ1잠복 코드가 아닌 생성망을 수정함으로써 GAN 역전이를 통해 실사 이미지의 거의 완벽한 재구성을 달성할 수 있는가?
  • RQ2잠복 코드가 아닌 생성망을 국소적으로 조정하는 것이 인코더 기반 또는 최적화 기반의 역전이에 비해 재구성 정밀도를 향상시키는가?
  • RQ3재구성된 이미지는 사진처럼 생겼고, 표준 GAN 편집 기법을 사용해 의미적으로 편집 가능한가?
  • RQ4이 방법은 훈련 데이터에서 소수집단에 대해 일반화되어 있으며, GAN 응용 분야의 다양성과 포용성을 향상시키는가?

주요 결과

  • 제안된 방법은 CelebA-HQ에서 평균 MSE 가 0.004 ± 0.006 으로, 다음으로 우수한 방법(Projection: 0.074 ± 0.055)보다 10배 이상 낮다.
  • LSUN-Horse 데이터셋에서는 MSE 가 0.005 ± 0.009 로, ReStyle(0.159 ± 0.070) 와 Projection(0.240 ± 0.195) 를 크게 앞서며 뛰어난 성능을 보였다.
  • 모든 데이터셋에서 LPIPS 점수는 상당히 낮았으며, CelebA-HQ 에서는 0.283 ± 0.050, LSUN-Horse 에서는 0.141 ± 0.043 로, 인지적 유사도가 뛰어나다는 것을 시사한다.
  • 재구성된 이미지는 실사 사진과 구분이 불가능하며, StyleSpace 및 비지도 편집 기법과 같은 표준 GAN 편집 도구를 사용해도 여전히 편집 가능하다.
  • 이 방법은 인간 얼굴, 동물, 차량 등 다양한 도메인에서 높은 성능를 유지하며, 넓은 적용 가능성을 보였다.
  • 이 방법은 소수집단에 대해 강건하며, 외부 분포 샘플에서 성능이 저하되는 데이터 분포 가정에 의존하지 않아서다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.