Skip to main content
QUICK REVIEW

[논문 리뷰] Do Not Escape From the Manifold: Discovering the Local Coordinates on the Latent Space of GANs

Jaewoong Choi, Jun-Ho Lee|arXiv (Cornell University)|2021. 06. 13.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 9
한 줄 요약

이 논문은 GAN의 잠재 공간에서 국소 기하학을 통한 탄젠트 공간 분석을 통해 의미적 분리가 가능한 이동 방향을 발견하는 비지도 방법인 Local Basis를 제안한다. $ω$-다양체의 국소 기하학을 분석함으로써, StyleGAN2의 $ω$-공간이 전반적으로 비틀려 있음을 밝혀내며, 이는 전역적 방법의 성공이 제한적인 이유를 설명한다. 국소적 이동과 그라스만다이언 기하학적 분석을 통해 우수한 안정성과 분리도를 입증한다.

ABSTRACT

The discovery of the disentanglement properties of the latent space in GANs motivated a lot of research to find the semantically meaningful directions on it. In this paper, we suggest that the disentanglement property is closely related to the geometry of the latent space. In this regard, we propose an unsupervised method for finding the semantic-factorizing directions on the intermediate latent space of GANs based on the local geometry. Intuitively, our proposed method, called Local Basis, finds the principal variation of the latent space in the neighborhood of the base latent variable. Experimental results show that the local principal variation corresponds to the semantic factorization and traversing along it provides strong robustness to image traversal. Moreover, we suggest an explanation for the limited success in finding the global traversal directions in the latent space, especially W-space of StyleGAN2. We show that W-space is warped globally by comparing the local geometry, discovered from Local Basis, through the metric on Grassmannian Manifold. The global warpage implies that the latent space is not well-aligned globally and therefore the global traversal directions are bound to show limited success on it.

연구 동기 및 목표

  • 전역적 방법이 실패하는 경우가 많은 GAN의 잠재 공간에서 안정적이고 의미적으로 유의미한 이동 방향을 찾는 데 도전한다.
  • GAN의 잠재 공간의 분리도 특성들이 기본적으로 그 기하학적 구조에 의해 결정되는지 조사한다.
  • 잠재 다양체의 내재 기하학에 기반해 국소적이고 안정적인 이동 방향을 식별하는 비지도 방법을 개발한다.
  • 국소 정보를 사용하여 StyleGAN2의 $ω$-공간의 전역 기하학을 평가하고, 전역 분리도를 측정하는 지표를 제안한다.
  • GANSpace와 SeFa와 같은 전역적 방법의 성공이 제한적인 이유를 잠재 공간의 전역 비틀림 정도를 정량화하여 설명한다.

제안 방법

  • Local Basis는 잠재 코드 $\mathbf{w}$에서의 탄젠트 공간 $T_{\mathbf{w}}\mathcal{W}$의 순서된 정규직교 기저로, 잠재 다양체의 국소 주요 변동을 나타낸다.
  • 이 방법은 생성자 네트워크의 야코비안 행렬의 특이벡터를 계산함으로써 국소 기저에 대한 해석적 해를 제공한다.
  • 그라스만다이언 다양체 거리 측도를 사용하여 서로 다른 잠재 코드 간의 국소 기저를 비교함으로써 기하학적 일관성과 비틀림 정도를 정량화한다.
  • 반복적 곡선 이동 방법은 Local Basis를 기반으로 잠재 다양체를 따라 곡선 경로를 따라 이동함으로써 선형 보간보다 이미지 이동의 안정성을 향상시킨다.
  • 그라스만다이언 상에서의 투영 및 지지곡선 거리 측도를 사용하여 근접한 잠재 코드와 먼 잠재 코드의 국소 기저를 비교함으로써 전역 분리도를 평가한다.

실험 결과

연구 질문

  • RQ1GAN의 잠재 공간에서 의미의 분리도가 다양체의 기하학적 구조와 본질적으로 연결되어 있는가?
  • RQ2국소 영역에서는 유망한 결과를 보였지만, 왜 GANSpace와 SeFa와 같은 전역적 이동 방법은 전반적으로 성공이 제한적인가?
  • RQ3국소 기하학적 분석을 통해 전역적 방법보다 더 안정적이고 의미적으로 의미 있는 이동 방향을 드러낼 수 있는가?
  • RQ4StyleGAN2의 $ω$-공간이 어느 정도 전역적으로 비틀려 있는가? 이는 전역 기저 방법의 성능에 어떤 영향을 미치는가?
  • RQ5국소 기저를 기반으로 한 반복적 곡선 이동 방법이 선형 보간보다 더 안정적인 이미지 변환을 생성할 수 있는가?

주요 결과

  • 그라스만다이언 거리 측도는 근접한 잠재 코드($|\mathbf{z}' - \mathbf{z}| = 0.1$)에서 유도된 Local Basis가 무작위 코드에서 유도된 것보다 유의미하게 더 일관성이 있음을 보여주며, 국소 기하학적 안정성을 시사한다.
  • 무작위 $\mathbf{w}$와 무작위 $O(d_{\mathcal{W}})$ 사이의 거리가 근접한 $\mathbf{w}$들 사이의 거리보다 훨씬 크므로, $\mathcal{W}$-공간이 전역적으로 비틀려 있음을 입증한다.
  • Local Basis는 GANSpace와 SeFa와 같은 전역적 방법보다 더 안정적이고 의미적으로 의미 있는 이미지 이동을 달성하며, 특히 이미지 품질과 의미 일관성 측면에서 뛰어나다.
  • Local Basis를 기반으로 한 반복적 곡선 이동 방법은 선형 이동보다 더 부드럽고 일관성 있는 이미지 시퀀스를 생성함으로써 더 높은 내구성을 입증한다.
  • GANSpace와 SeFa의 전역 기저는 근접한 $\mathbf{w}$와의 비교에서 높은 거리 측도를 보이며, 국소 기하학과의 일치도가 제한적이므로, 전역 분리도가 완전하지 않음을 시사한다.
  • 분석을 통해 전역적 방법의 성공이 제한적인 이유가 $\mathcal{W}$-공간의 전역 비틀림 때문임을 확인하였으며, 이는 잠재 공간 전반에 걸쳐 일관된 의미적 방향성을 파괴하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.