Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Representation Learning with Wasserstein Total Correlation

Yijun Xiao, William Yang Wang|arXiv (Cornell University)|Dec 30, 2019
Generative Adversarial Networks and Image Synthesis参考文献 36被引用数 8
ひとこと要約

本稿では、KLダイバージェンスに基づくトータル相関の代わりに、より安定性の高いワサースタイン距離に基づく代替手法であるワサースタイン全相関(WTC)を提案する。VAEおよびWAEフレームワークの両方において、コメンスネットワークを訓練してWTCを推定することで、最小限の再構成誤差で最先端の分離表現学習を達成し、複数のベンチマークで既存手法を上回る。また、より信頼性の高い評価のための新しい指標であるワサースタイン依存ギャップ(WDG)を導入する。

ABSTRACT

Unsupervised learning of disentangled representations involves uncovering of different factors of variations that contribute to the data generation process. Total correlation penalization has been a key component in recent methods towards disentanglement. However, Kullback-Leibler (KL) divergence-based total correlation is metric-agnostic and sensitive to data samples. In this paper, we introduce Wasserstein total correlation in both variational autoencoder and Wasserstein autoencoder settings to learn disentangled latent representations. A critic is adversarially trained along with the main objective to estimate the Wasserstein total correlation term. We discuss the benefits of using Wasserstein distance over KL divergence to measure independence and conduct quantitative and qualitative experiments on several data sets. Moreover, we introduce a new metric to measure disentanglement. We show that the proposed approach has comparable performances on disentanglement with smaller sacrifices in reconstruction abilities.

研究の動機と目的

  • 分離表現学習におけるトータル相関推定に用いられるKLダイバージェンスの不安定さと指標に依存しない性質を是正すること。
  • ワサースタイン距離を用いた幾何学的感度の高いKLベースの全相関の代替手法の開発。
  • 同一のWTCの原則に基づく新しい分離指標、ワサースタイン依存ギャップ(WDG)の導入。
  • 教師なし表現学習における分離性と再構成品質のトレードオフの改善。

提案手法

  • KLベースの全相関の代替として、指標に依存しない幾何学的感度の高いワサースタイン全相関(WTC)を提案。
  • VAEおよびワサースタイン自己オートエンコーダー(WAE)フレームワークの両方において、WTC項の推定をコメンスネットワークを敵対的に訓練することで実現。
  • WTCをオートエンコーダーの目的関数に統合し、分離性と再構成のバランスをとるために正則化強度ハイパーパrameter γ を導入。
  • WTCと同一の原則に基づく新しい分離指標として、ワサースタイン依存ギャップ(WDG)を導入。
  • WTC項の安定的推定を保証するため、勾配ペナルティを用いてコメンスネットワークを訓練し、リプシッツ連続性を確保。
  • モンテカルロサンプリングとミニバッチ学習を用いて、スケーラブルな方法でWTC正則化目的関数を最適化。

実験結果

リサーチクエスチョン

  • RQ1KLダイバージェンスと比較して、全相関のワサースタイン距離に基づく定式化は、分離表現学習の安定性と頑健性を向上させるか。
  • RQ2提案されたワサースタイン全相関(WTC)は、低い再構成誤差を維持しながら、より良い分離性を達成するか。
  • RQ3新しいワサースタイン依存ギャップ(WDG)指標は、従来の指標よりも信頼性が高く一貫性のある分離性評価を提供できるか。
  • RQ4WTCの正則化強度が、分離性と再構成性能のトレードオフに与える影響は何か。

主な発見

  • WTC-VAEは、dSprites、Shapes3D、Cars3Dの3つのデータセットにおいて、最先端のモデルと同等またはそれ以上の分離スコアを達成し、VAEベースの手法の中で最小の再構成誤差を記録した。
  • WTC-WAEは標準的なWAEと比較して一貫した性能向上を示し、WAEフレームワークにおけるWTCの有効性を裏付けた。
  • 提案されたワサースタイン依存ギャップ(WDG)指標は、FactorVAE、MIG、およびモジュラリティと高いランク相関を示し、信頼性が高く一貫性のある評価指標であることが示された。
  • dSpritesおよびShapes3Dでは、WTC正則化強度γを増加させることでWDGスコアが上昇し、より強い正則化が分離性の向上に寄与することがわかった。
  • CelebAでは、WTC-VAEがクセのある髪型や顔の幅といった意味のある細分化要因を効果的に発見し、定性的な分離性を示した。
  • 高い分離性レベルでも強力な再構成性能を維持しており、分離性と再構成のトレードオフのプロットにおいて、上左領域に位置づけられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。