Skip to main content
QUICK REVIEW

[論文レビュー] Improving Relational Regularized Autoencoders with Spherical Sliced Fused Gromov Wasserstein

Khai T. Nguyen, Son Nguyen|arXiv (Cornell University)|Oct 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 38被引用数 6
ひとこと要約

本稿では、球面上のスライス融合Gromov Wasserstein(SSFG)およびその変種—混合SSFG(MSSFG)とパワーSSFG(PSSFG)—を提案し、von Mises-Fisher(vMF)分布およびその変種をスライシング分布として用いることで、関係性正則化付きオートエノミー(RAE)のより情報豊かな投影を学習することにより、性能を向上させる。この手法により潜在空間の正則化が強化され、ベースラインのSFGおよびmax-SFG手法と比較して、画像生成および再構成性能が優れている。

ABSTRACT

Relational regularized autoencoder (RAE) is a framework to learn the distribution of data by minimizing a reconstruction loss together with a relational regularization on the latent space. A recent attempt to reduce the inner discrepancy between the prior and aggregated posterior distributions is to incorporate sliced fused Gromov-Wasserstein (SFG) between these distributions. That approach has a weakness since it treats every slicing direction similarly, meanwhile several directions are not useful for the discriminative task. To improve the discrepancy and consequently the relational regularization, we propose a new relational discrepancy, named spherical sliced fused Gromov Wasserstein (SSFG), that can find an important area of projections characterized by a von Mises-Fisher distribution. Then, we introduce two variants of SSFG to improve its performance. The first variant, named mixture spherical sliced fused Gromov Wasserstein (MSSFG), replaces the vMF distribution by a mixture of von Mises-Fisher distributions to capture multiple important areas of directions that are far from each other. The second variant, named power spherical sliced fused Gromov Wasserstein (PSSFG), replaces the vMF distribution by a power spherical distribution to improve the sampling time in high dimension settings. We then apply the new discrepancies to the RAE framework to achieve its new variants. Finally, we conduct extensive experiments to show that the new proposed autoencoders have favorable performance in learning latent manifold structure, image generation, and reconstruction.

研究の動機と目的

  • スライス融合Gromov Wasserstein(SFG)における一様スライシングの限界を解消する。一様スライシングはすべての方向を同様に扱い、乖離度を低く評価してしまう。
  • 特徴的で影響力の高い投影方向に焦点を当てることで、オートエノミーにおける関係性正則化を改善する。
  • 次元の呪いを回避し、高次元で効率的なサンプリングを可能にする、原理的かつ明確に定義された乖離度測度を開発する。
  • SFGに適応的で方向に依存する事前分布(vMFおよびその変種)を組み込むことで、潜在空間内の複雑なデータ構造をよりよく捉える。
  • MNISTおよびCelebAにおける生成および再構成性能の向上を目的として、新しい乖離度測度をオートエノミー枠組みで評価する。

提案手法

  • 球面上のスライス融合Gromov Wasserstein(SSFG)を提案。von Mises-Fisher(vMF)分布を用いて投影方向をサンプリングし、事前分布と集約後分布を最も効果的に分離する領域に集中させる。
  • 混合SSFG(MSSFG)を導入。複数のvMF分布の混合を用いることで、同時に複数の離れた高影響度方向を特定する。
  • パワーSSFG(PSSFG)を提案。vMFの代わりにパワー球面分布を用いることで、高次元設定におけるサンプリングを高速化する。
  • SSFGおよびその変種をRAEフレームワークにおける関係性正則化として適用し、新たなオートエノミー変種(s-DRAE、MSSFG-RAE、PSSFG-RAE)を構築する。
  • vMF分布上での最尤推定に基づく反復的最適化を用い、最良の投影方向を段階的に改善する確率的最適化手法を採用する。
  • 画像再構成および生成のため、全結合層および転置畳み込み層を備えた標準的な深層オートエノミー構造を用いる。

実験結果

リサーチクエスチョン

  • RQ1SFGにおける一様スライシングをvMF分布に置き換えることで、オートエノミーにおける関係性正則化の質が向上するか?
  • RQ2vMF分布の混合を用いることで、一様スライシングや単一方向スライシングが見逃す、複数の多様で高影響度の投影方向をモデルが発見できるか?
  • RQ3パワー球面分布を用いることで、性能を損なわせることなく、高次元潜在空間におけるサンプリング時間を短縮できるか?
  • RQ4SSFGに基づくRAEは、SFGに基づくRAEおよびmax-SFGに基づくRAEと比較して、画像生成および再構成の忠実度において優れているか?
  • RQ5提案手法は、計算効率を維持しつつ、事前分布と集約後分布の乖離度を効果的に低減するか?

主な発見

  • SSFGに基づくオートエノミー(s-DRAE)は、SFGおよびmax-SFGと比較して、4つのガウスモードの生成において収束が早く、分布マッチングの質が優れている。
  • MSSFGはモード間の重複を回避し、モード分離が向上しており、明確なデータ構造の捉えが良いことを示している。
  • PSSFGは高次元設定においてサンプリング時間を短縮しながらも、競争力のある性能を維持しており、スケーラビリティを示している。
  • MNISTおよびCelebAにおいて、提案手法のオートエノミーは、SFGベースのベースラインと比較してFIDスコアが低く、再構成MSEも優れている。
  • vMFおよびその変種をスライシング分布として用いることで、次元の呪いを回避する明確な擬似距離測度が得られることを実証した。
  • 実験的結果から、vMFや混合vMFといった方向性事前分布は、一様分布や最大方向スライシングに比べ、意味のある潜在空間構造をより効果的に捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。