Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Inference in Pre-trained Variational Autoencoders via Cross-coding

Ga Wu, Justin Domke|arXiv (Cornell University)|May 20, 2018
Generative Adversarial Networks and Image Synthesis参考文献 9被引用数 6
ひとこと要約

本稿では、再訓練を伴わずに事前学習済み変分オートエンコーダー(VAEs)における効率的な条件付き推論を実現するクロスコーディングという手法を提案する。エビデンスを前提とした潜在変数の事後分布を近似するためにクロスコーダー・ネットワークを用いることで、任意のクエリ・エビデンス分解における高速サンプリングが可能となり、定量的・定性的な評価においてハミルトニアン・モンテカルロ(HMC)を上回る性能を示す。特に高次元設定において顕著な優位性を示す。

ABSTRACT

Variational Autoencoders (VAEs) are a popular generative model, but one in which conditional inference can be challenging. If the decomposition into query and evidence variables is fixed, conditional VAEs provide an attractive solution. To support arbitrary queries, one is generally reduced to Markov Chain Monte Carlo sampling methods that can suffer from long mixing times. In this paper, we propose an idea we term cross-coding to approximate the distribution over the latent variables after conditioning on an evidence assignment to some subset of the variables. This allows generating query samples without retraining the full VAE. We experimentally evaluate three variations of cross-coding showing that (i) they can be quickly optimized for different decompositions of evidence and query and (ii) they quantitatively and qualitatively outperform Hamiltonian Monte Carlo.

研究の動機と目的

  • 任意のクエリ・エビデンス分解が要求される状況下で、事前学習済みVAEsにおける効率的な条件付き推論を解決すること。
  • 各新しい分解ごとに再訓練が必要となる条件付きVAEsの限界を克服すること。
  • 高次元潜在空間において混合時間が長くなるという欠点を抱えるMCMC手法(例:ハミルトニアン・モンテカルロ)を改善すること。
  • 事前学習済みデコーダーを再利用し、高価な再訓練を回避する変分推論フレームワークを開発すること。
  • クロスコーディングが多様なデータセットおよびクエリタイプにおいて、高速かつ高品質なサンプリングを実現できることを示すこと。

提案手法

  • エビデンス $\mathbf{x}$ に対して、ノイズ $\bm{\epsilon}$ を条件付き潜在分布 $q_{\psi}(\mathbf{z}|\mathbf{x})$ にマップするクロスコーダー・ネットワーク $\mathrm{XCoder}_{\psi}(\bm{\epsilon})$ を導入する。
  • 真の条件付き尤度 $p_{\theta}(\mathbf{y}|\mathbf{x})$ の下界をタイトにするために、条件付きエビデンス下界(C-ELBO)を最適化する。
  • 確率的サンプリングプロセスを効率的にバックプロパゲートするために、再パrameterization勾配を採用する。
  • ガウス変分推論(GVI)、ノーマライジングフロー(NF)、および完全結合ネットワーク(FCN)の3つのバリエーションを比較のために採用する。
  • M回のサンプルをクロスコーダーから得ることで、デコーダー $p_{\theta}(\mathbf{t}|\mathbf{z})$ を用いて条件付き分布 $p_{\theta}(\mathbf{y}|\mathbf{x})$ からのサンプルを生成する。
  • KLダイバージェンスにおける有益なキャンセル効果のおかげで、クエリ分布の誤差は潜在事後分布の誤差に制御される。

実験結果

リサーチクエスチョン

  • RQ1クロスコーディングは、デコーダーの再訓練を伴わず、事前学習済みVAEsにおける高速かつ高精度な条件付き推論を可能にするか?
  • RQ2高次元潜在空間において、クロスコーディングはハミルトニアン・モンテカルロ(HMC)と比較して、サンプリング品質および混合時間の点で優れているか?
  • RQ3GVI、NF、FCNといった異なるクロスコーダー・アーキテクチャは、さまざまなクエリ・エビデンス分解において顕著に異なる性能を示すか?
  • RQ4C-ELBOは、VAEsにおける条件付きサンプリング品質を評価するための信頼できる代理指標とみなせるか?
  • RQ5クロスコーディングは、MNIST、アニメ、CelebAといった多様なデータセットにおいて、異なる潜在次元数でも性能を維持できるか?

主な発見

  • アニメデータセットにおいて、ガウス変分推論(GVI)のクロスコーダーは、ノーマライジングフロー(NF)およびハミルトニアン・モンテカルロ(HMC)を上回り、C-ELBOおよびクエリ周辺尤度の両面で優れた性能を示した。
  • CelebAデータセットでは、GVIはNFと同等またはわずかに劣る性能を示したが、両者とも定量的・定性的な指標においてHMCを著しく上回った。
  • HMCは高次元設定(64および100の潜在次元)において混合が悪く、サンプルが過剰に集中し、多様性に欠ける結果を示した。
  • 低次元のMNIST実験では、すべてのクロスコーダー・バージョン(GVI、NF、FCN)が良好に機能し、C-ELBOおよび尤度指標においてGVIとNFがHMCを上回った。
  • クロスコーダー・フレームワークにより、任意のクエリ・エビデンス分解に対して高速な最適化が可能となり、VAEデコーダーの再訓練が一切不要となった。
  • 定性的な結果から、GVIはエビデンスに一致する多様で高品質なサンプルを生成したが、HMCおよびNFはしばしば単一モードに収束する傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。