Skip to main content
QUICK REVIEW

[논문 리뷰] The Geometry of Deep Generative Image Models and its Applications

Binxu Wang, Carlos R. Ponce|arXiv (Cornell University)|2021. 01. 15.
Generative Adversarial Networks and Image Synthesis인용 수 21
한 줄 요약

이 논문은 헤시안 기반 고유분해를 통해 이미지 다양체의 리만계량을 계산하여 딥 생성 이미지 모델(GANs)의 잠재공간을 기하학적 프레임워크로 분석하는 방법을 제안한다. 이는 GAN의 잠재공간이 매우 이방성이고 균일하다는 것을 드러내며, 최상위 고유벡터들이 해석 가능한 이미지 변환에 대응함으로써 아키텍처에 대한 가정 없이도 효율적인 GAN 역전환과 비지도 의미 있는 방향 탐색을 가능하게 한다.

ABSTRACT

Generative adversarial networks (GANs) have emerged as a powerful unsupervised method to model the statistical patterns of real-world data sets, such as natural images. These networks are trained to map random inputs in their latent space to new samples representative of the learned data. However, the structure of the latent space is hard to intuit due to its high dimensionality and the non-linearity of the generator, which limits the usefulness of the models. Understanding the latent space requires a way to identify input codes for existing real-world images (inversion), and a way to identify directions with known image transformations (interpretability). Here, we use a geometric framework to address both issues simultaneously. We develop an architecture-agnostic method to compute the Riemannian metric of the image manifold created by GANs. The eigen-decomposition of the metric isolates axes that account for different levels of image variability. An empirical analysis of several pretrained GANs shows that image variation around each position is concentrated along surprisingly few major axes (the space is highly anisotropic) and the directions that create this large variation are similar at different positions in the space (the space is homogeneous). We show that many of the top eigenvectors correspond to interpretable transforms in the image space, with a substantial part of eigenspace corresponding to minor transforms which could be compressed out. This geometric understanding unifies key previous results related to GAN interpretability. We show that the use of this metric allows for more efficient optimization in the latent space (e.g. GAN inversion) and facilitates unsupervised discovery of interpretable axes. Our results illustrate that defining the geometry of the GAN image manifold can serve as a general framework for understanding GANs.

연구 동기 및 목표

  • GAN 생성 이미지 다양체의 기하학적 구조를 아키텍처에 종속되지 않게 분석하기 위한 방법을 개발하는 것.
  • 해석 가능성과 최적화를 제한하는 GAN 내 고차원 비선형 잠재공간을 이해하는 데 도전하는 것.
  • 기존의 GAN에서 해석 가능한 분리된 방향에 대한 연구를 통합하기 위해, 리만계량의 최상위 고유벡터가 의미 있는 이미지 변환에 대응한다는 것을 드러내는 것.
  • 계량 텐서에서 유도된 기하학적 사전 지식을 통해 더 효율적인 GAN 역전환과 비지도 해석 가능한 축 탐색을 가능하게 하는 것.
  • 재학습이나 인코더 네트워크가 필요 없이 GAN을 사후 분석할 수 있는 도구를 제공하는 것.

제안 방법

  • 생성자 출력의 헤시안을 사용하여 잠재 코드 $\mathbf{z}$ 에 대해 이미지 거리 함수를 미분함으로써 GAN이 생성한 이미지 다양체의 리만계량 텐서 $H$ 를 계산한다.
  • 잠재공간의 여러 지점에서 계량 텐서 $H$ 의 고유분해를 수행하여 이미지 변동의 주요 방향을 식별한다.
  • 이미지 공간에서의 리만거리 정의를 잠재공간으로 끌어올려 미분기하학적 구조를 구성한다.
  • 에코더 네트워크나 아키텍처 수정 없이 사전 학습된 GANs(예: StyleGAN2, BigGAN)에 이 방법을 적용한다.
  • $H$ 의 고유스펙트럼과 고유벡터를 사용하여 해석 가능한 이미지 변환을 식별하고 순위를 매긴다. 높은 고유값은 더 큰 이미지 변동성을 나타낸다.
  • 이전 연구(예: Peebles et al., 2020)와의 비교를 위해 식별된 축이 최상위 고유공간에 얼마나 잘 투영되는지 측정한다.

실험 결과

연구 질문

  • RQ1GAN이 생성하는 이미지 다양체의 내재 기하학적 구조는 이방성과 균일성 측면에서 어떻게 되어 있는가?
  • RQ2잠재공간의 주요 변동 방향은 해석 가능한 이미지 변환(예: 얼굴 특징, 색상, 형태 변화 등)과 어떻게 관련되어 있는가?
  • RQ3네트워크 아키텍처에 종속되지 않게, GAN 다양체의 리만계량 텐서를 효율적이고 정확하게 계산할 수 있는가?
  • RQ4이전에 식별된 해석 가능한 축들이 헤시안 기반 계량의 최상위 고유벡터와 어느 정도 일치하는가?
  • RQ5계량 텐서에서 유도된 기하학적 통찰은 GAN 역전환과 비지도 분리 등 후행 작업을 향상시킬 수 있는가?

주요 결과

  • GAN이 생성하는 이미지 다양체는 매우 이방성이며, 잠재공간의 다양한 지점에서조차 이미지 변동이 놀랍게 소수의 주요 축에 집중되어 있다.
  • 공간은 균일하며, 계량 텐서의 주요 고유벡터들이 잠재코드의 위치에 관계없이 유사하여 일관된 변환 방향을 나타낸다.
  • 최상위 고유공간의 상당 부분이 해석 가능한 이미지 변환(예: 얼굴 특징, 색상, 형태 등)에 대응하며, 보조 성분은 압축 가능하다.
  • 상위 10개 고유벡터는 이전 연구에서 식별된 대부분의 해석 가능한 축에 대해 95% 이상의 에너지를 포괄하며, 90%의 경우에서 투영 능력이 0.95를 초과한다.
  • 이 방법은 점당 12초 내로 헤시안과 그 고유분해를 계산할 수 있으며, 반복 최적화가 필요한 기존 방법의 40분/에포크 대비 훨씬 빠르다.
  • 이전 연구에서 해석 가능한 것으로 식별된 축들은 최상위 고유공간과 높은 일치도(평균 투영 능력 0.95±0.05)를 보였고, 비해석 가능한 축들은 상위 10차원 고유공간에서 평균 0.103±0.141의 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.