Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Relational Regularized Autoencoders with Spherical Sliced Fused Gromov Wasserstein

Khai T. Nguyen, Son Nguyen|arXiv (Cornell University)|2020. 10. 05.
Generative Adversarial Networks and Image Synthesis참고 문헌 38인용 수 6
한 줄 요약

이 논문은 관계 정규화 자동에코더(RAE)의 성능을 향상시키기 위해 구면 슬라이스드 융합 글로모프 워셔스타인(SSF)과 그 변종인 혼합 SSFG(MSSFG), 힘 SSFG(PSSFG)를 제안한다. 이는 슬라이싱 분포로 비온-미제-피셔(vMF) 분포와 그 변종을 사용하여 더 정보량이 많은 투영을 학습함으로써 이루어진다. 이 방법은 잠재 공간 정규화를 향상시켜 기준 SFG 및 max-SFG 방법에 비해 우수한 이미지 생성 및 복원 성능을 달성한다.

ABSTRACT

Relational regularized autoencoder (RAE) is a framework to learn the distribution of data by minimizing a reconstruction loss together with a relational regularization on the latent space. A recent attempt to reduce the inner discrepancy between the prior and aggregated posterior distributions is to incorporate sliced fused Gromov-Wasserstein (SFG) between these distributions. That approach has a weakness since it treats every slicing direction similarly, meanwhile several directions are not useful for the discriminative task. To improve the discrepancy and consequently the relational regularization, we propose a new relational discrepancy, named spherical sliced fused Gromov Wasserstein (SSFG), that can find an important area of projections characterized by a von Mises-Fisher distribution. Then, we introduce two variants of SSFG to improve its performance. The first variant, named mixture spherical sliced fused Gromov Wasserstein (MSSFG), replaces the vMF distribution by a mixture of von Mises-Fisher distributions to capture multiple important areas of directions that are far from each other. The second variant, named power spherical sliced fused Gromov Wasserstein (PSSFG), replaces the vMF distribution by a power spherical distribution to improve the sampling time in high dimension settings. We then apply the new discrepancies to the RAE framework to achieve its new variants. Finally, we conduct extensive experiments to show that the new proposed autoencoders have favorable performance in learning latent manifold structure, image generation, and reconstruction.

연구 동기 및 목표

  • 균일한 슬라이싱이 모든 방향을 동일하게 취급하고 차이를 과소 평가하는 SFG의 한계를 해결하기 위해.
  • 구분력 있고 영향력 있는 투영 방향에 집중함으로써 자동에코더의 관계 정규화를 향상시키기 위해.
  • 차원의 저주를 피하고 고차원에서 효율적인 샘플링을 지원하는 원칙적이고 잘 정의된 거리 측정법을 개발하기 위해.
  • SFG를 비온-미제-피셔(vMF) 및 그 변종과 같은 적응형 방향 사전을 도입하여, 잠재 공간 내 복잡한 데이터 구조를 더 잘 포착하도록 확장하기 위해.
  • MNIST 및 CelebA에서의 이미지 생성 및 복원 성능 향상을 위해 새로운 거리 측정법을 자동에코더 프레임워크에 평가하기 위해.

제안 방법

  • 비온-미제-피셔(vMF) 분포를 사용해 투영 방향을 샘플링하는 구면 슬라이스드 융합 글로모프 워셔스타인(SSFG)을 제안하며, 사전과 집합된 사후분포를 가장 잘 분리하는 영역에 집중한다.
  • 다중 vMF 분포를 사용해 동시에 여러 개의 거리가 먼 고영향력 방향을 식별하는 혼합 SSFG(MSSFG)를 도입한다.
  • vMF를 힘 구면 분포로 대체하여 고차원 설정에서 샘플링 속도를 향상시키는 힘 SSFG(PSSFG)를 개발한다.
  • SSFG 및 그 변종을 RAE 프레임워크 내의 관계 정규화로 적용하여 새로운 자동에코더 변종인 s-DRAE, MSSFG-RAE, PSSFG-RAE를 구성한다.
  • vMF 분포에 대한 최대우도 추정을 사용해 반복적으로 최적의 투영 방향을 개선하는 스토케스틱 최적화를 구현한다.
  • 이미지 복원 및 생성을 위해 완전히 연결된 신경망 및 전치 컨볼루션 레이어를 사용하는 표준 딥 자동에코더 아키텍처를 적용한다.

실험 결과

연구 질문

  • RQ1SFG에서 균일한 슬라이싱을 vMF 분포로 대체하면 자동에코더의 관계 정규화 품질이 향상되는가?
  • RQ2vMF 분포의 혼합을 사용하면 균일하거나 단일 방향 샘플링이 놓치는 다수의 다양하고 고영향력 있는 투영 방향을 모델이 발견할 수 있는가?
  • RQ3힘 구면 분포를 사용하면 고차원 잠재 공간에서 성능을 유지하면서도 샘플링 시간을 줄일 수 있는가?
  • RQ4SSFG 기반 RAE는 SFG 기반 및 max-SFG 기반 RAE에 비해 이미지 생성 및 복원 정밀도 측면에서 어떻게 비교되는가?
  • RQ5제안된 방법은 차원의 저주를 피하면서 사전과 집합된 사후분포 간의 차이를 효과적으로 줄이고 계산 효율성을 유지하는가?

주요 결과

  • SSFG 기반 자동에코더(s-DRAE)는 SFG 및 max-SFG에 비해 4개의 가우시안 모드 생성에서 더 빠른 수렴과 더 나은 분포 매칭 성능을 달성한다.
  • MSSFG는 모드 간 교차 영역에서의 과도한 표현을 방지하며 모드 간 분리가 향상되어, 더 잘 정의된 데이터 구조를 포착함을 시사한다.
  • PSSFG는 고차원 설정에서 샘플링 시간을 단축시키면서도 경쟁력 있는 성능을 유지하여 확장성의 우수성을 입증한다.
  • MNIST 및 CelebA에서 제안된 자동에코더는 SFG 기반 기준보다 더 낮은 FID 점수와 더 낮은 복원 MSE 성능을 기록한다.
  • vMF 및 그 변종을 슬라이싱 분포로 사용하면 차원의 저주를 피하는 잘 정의된 의사거리 측정법이 도출된다.
  • 실험 결과는 vMF 및 혼합 vMF와 같은 방향 사전이 균일 샘플링 및 최대 방향 샘플링보다 더 의미 있는 잠재 구조를 포착하는 데 뛰어나다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.