Skip to main content
QUICK REVIEW

[논문 리뷰] Increasing Expressivity of a Hyperspherical VAE

Tim R. Davidson, Jakub M. Tomczak|arXiv (Cornell University)|2019. 10. 07.
Gaussian Processes and Bayesian Inference참고 문헌 23인용 수 4
한 줄 요약

이 논문은 단일 고차원 초구를 여러 개의 독립적인 하위초구로 분해함으로써 표현력을 향상시키는 제품공간 초구형 VAE를 제안한다. 각 하위초구는 자체 농도 매개변수를 가지며, von Mises-Fisher 분포의 스칼라 농도 매개변수를 각 하위공간에 맞는 매개변수로 대체함으로써, MNIST, Caltech, Omniglot 등의 이미지 데이터셋에서 표준 초구형 VAE와 가우시안 VAE보다 유의미하게 향상된 우도와 분리도를 달성한다.

ABSTRACT

Learning suitable latent representations for observed, high-dimensional data is an important research topic underlying many recent advances in machine learning. While traditionally the Gaussian normal distribution has been the go-to latent parameterization, recently a variety of works have successfully proposed the use of manifold-valued latents. In one such work (Davidson et al., 2018), the authors empirically show the potential benefits of using a hyperspherical von Mises-Fisher (vMF) distribution in low dimensionality. However, due to the unique distributional form of the vMF, expressivity in higher dimensional space is limited as a result of its scalar concentration parameter leading to a 'hyperspherical bottleneck'. In this work we propose to extend the usability of hyperspherical parameterizations to higher dimensions using a product-space instead, showing improved results on a selection of image datasets.

연구 동기 및 목표

  • 고차원 잠재공간에서 von Mises-Fisher(vMF) 분포의 단일 스칼라 농도 매개변수로 인한 표현력의 한계를 해결하기 위해.
  • 잠재공간을 낮은 차원의 초구들의 카르테시안 곱으로 분해함으로써 초구형 VAE의 표현 능력을 향상시키기 위해.
  • 각 하위초구에 대해 독립적인 농도 매개변수를 도입함으로써 생성 모델링의 유연성과 분리도를 높이기 위해.
  • 기준 이미지 데이터셋에서 실험적으로 방법을 검증하여, 더 나은 우도와 재구성 성능을 보여주기 위해.
  • 제품공간 구조가 모델의 단순성에 손상을 주지 않으면서도 '초구형 브로드럽'을 완화시킨다는 것을 보여주기 위해.

제안 방법

  • 잠재공간 $\mathcal{S}_M$ 을 $k+1$ 개의 독립적인 하위초구 $\mathcal{S}_{M_0} \times \cdots \times \mathcal{S}_{M_k}$ 로 분해하며, 여기서 $\sum M_i = M$ 이다.
  • 각 하위초구는 자체 농도 매개변수 $\kappa_i$ 를 갖는 von Mises-Fisher 분포로 모델링되어 각 차원의 유연성이 증가한다.
  • 공선분포와 사후분포는 조건부 독립성을 가정하여 $p(\mathbf{z}) = \prod_i p(\mathbf{z}_i)$ 와 $q(\mathbf{z}|\mathbf{x}) = \prod_i q(\mathbf{z}_i|\mathbf{x})$ 로 인수분해된다.
  • KL 발산은 $\mathrm{KL}(q(\mathbf{z}|\mathbf{x})||p(\mathbf{z})) = \sum_i \mathrm{KL}(q(\mathbf{z}_i|\mathbf{x})||p(\mathbf{z}_i))$ 로 분해되어 효율적인 최적화를 가능하게 한다.
  • 재표본화 기반 경사 하강법을 사용한 변분 추론으로 학습되며, vMF의 해석 가능한 정규화 상수와 수정 Bessel 함수를 활용한다.
  • 로그우도, 재구성 오차, KL 발산을 메트릭으로 사용하여 MNIST, Caltech-101, Omniglot에서 평가된다.

실험 결과

연구 질문

  • RQ1초구 성분들의 제품공간 구조가 단일 vMF 분포를 초월해 VAE의 표현력을 향상시킬 수 있는가?
  • RQ2각 하위공간에 대해 농도 매개변수를 도입함으로써 고차원 잠재공간에서의 '초구형 브로드럽' 현상을 완화할 수 있는가?
  • RQ3표준 가우시안 VAE와 단일 초구형 vMF VAE에 비해 제품공간 vMF VAE는 우도와 분리도 측면에서 어떻게 성능을 내는가?
  • RQ4하위초구들이 이미지 데이터에서 의미적으로 의미 있는 분리된 요소들을 학습할 수 있는가?
  • RQ5모델 성능 측면에서 하위초구의 수와 농도 매개변수의 수 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • MNIST에서 제품공간 vMF VAE는 -92.50의 로그우도를 기록하여, 최고의 단일 $\mathcal{S}_m$-VAE의 -96.32를 능가했다.
  • Caltech-101에서 모델은 -139.84의 로그우도를 기록하여, 단일 $\mathcal{S}_m$-VAE의 -143.49보다 유의미하게 뛰어났다.
  • Omniglot에서 제품공간 모델은 -112.58의 로그우도를 기록하여, 단일 $\mathcal{S}_m$-VAE의 -113.83를 뛰어넘었다.
  • 모델은 개선된 분리도를 보였으며, 특정 하위초구가 붓기 두께와 같은 의미론적 속성을 제어하는 것으로 확인되었고, 보간 시각화를 통해 이를 확인할 수 있었다.
  • 특히 고차원 설정에서 표준 vMF 및 가우시안 VAE보다 더 낮은 재구성 오차와 더 안정적인 학습을 보였다.
  • 제거 분석을 통해 하위초구의 수와 농도 매개변수의 수를 늘일수록 성능 향상이 있었으며, $[\mathcal{S}_7]_{\times 5} \times \mathcal{S}_5$ 가 모든 데이터셋에서 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.