Skip to main content
QUICK REVIEW

[論文レビュー] Learning Deep Generative Models with Annealed Importance Sampling

Xinqiang Ding, David J. Freedman|arXiv (Cornell University)|Jun 12, 2019
Generative Adversarial Networks and Image Synthesis参考文献 34被引用数 7
ひとこと要約

本論文では、ジャルジンスキー等式にインspiredされた、アニーリング重要度サンプリング(AIS)を用いて、変分推論(VI)とマルコフ連鎖モンテカルロ(MCMC)を統合することで、深層生成モデルの学習を改善することを提案する。変分オートエンコーダー(VAE)と重要度重み付きオートエンコーダー(IWAE)を一般化し、メモリ使用量を増加させることなく、計算量と精度のトレードオフを効率的に実現することで、MNISTおよびOmniglotデータセットにおいてIWAEやMH-HMCを上回る性能を達成する。

ABSTRACT

Variational inference (VI) and Markov chain Monte Carlo (MCMC) are two main approximate approaches for learning deep generative models by maximizing marginal likelihood. In this paper, we propose using annealed importance sampling for learning deep generative models. Our proposed approach bridges VI with MCMC. It generalizes VI methods such as variational auto-encoders and importance weighted auto-encoders (IWAE) and the MCMC method proposed in (Hoffman, 2017). It also provides insights into why running multiple short MCMC chains can help learning deep generative models. Through experiments, we show that our approach yields better density models than IWAE and can effectively trade computation for model accuracy without increasing memory cost.

研究の動機と目的

  • 深層生成モデルにおける最大尤度学習の際、計算不能な後部分布を近似する課題に対処すること。
  • 変分推論(VI)とマルコフ連鎖モンテカルロ(MCMC)の間のギャップを埋め、より正確な尤度推定を実現すること。
  • AISを用いてVAE、IWAE、MCMCベースの学習を統一的に一般化するフレームワークの構築。
  • 計算コストとモデルの精度の間の有効なトレードオフを実現し、メモリ使用量を増加させずに実現すること。
  • 複数の短いMCMCチェインがモデル学習をどのように改善するか、その理由を理論的・実験的に解明すること。

提案手法

  • 本手法は、提案分布からターゲットの後部分布への段階的分布の系列を用いて、対数周辺尤度の勾配を推定するためにアニーリング重要度サンプリング(AIS)を用いる。
  • 勾配推定器は、温度スケジュール $\beta_t$ が 0 から 1 に変化する分布の経路に沿って重み付きサンプルの期待値として定式化される。
  • コアとなる推定器は、複数の重要度サンプリング経路と適応的重み付けを許容することで、IWAEを一般化し、後部分布の近似を向上させる。
  • 自由形式の温度スケジュール $\beta_t$ を用い、$0 = \beta_0 \leq \cdots \leq \beta_T = 1$ を満たすことで、柔軟な経路構築を可能にする。
  • サンプルの質を向上させるために、AISフレームワーク内にMCMCステップ(例:MH-HMC)を統合し、アニーリング経路に沿ってサンプルを精錬する。
  • 単一および複数のサンプル経路をサポートし、$K$(サンプル数)および$T$(アニーリングステップ数)が増加するほど性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1アニーリング重要度サンプリングは、深層生成モデル学習におけるVIとMCMC手法を統一的に一般化するフレームワークとして利用可能か?
  • RQ2標準的なVAEやIWAEと比較して、AISは周辺尤度推定をどのように改善するか?
  • RQ3複数の短いMCMCチェインがモデル学習を改善するのはなぜか?この現象をAISフレームワーク内で形式化可能か?
  • RQ4同じ計算コストのもとで、AISはIWAEやMH-HMCを上回るモデル精度を達成可能か?
  • RQ5$K$(サンプル数)と$T$(アニーリングステップ数)を増加させた場合、モデル性能と計算効率にどのような影響があるか?

主な発見

  • Omniglotデータセットにおいて、$L=5$、$K=50$、$T=11$ の条件下で、テスト尤度が -101.64 に達し、同じ計算コスト下でIWAE-DReGやMH-HMCを上回った。
  • 同一の計算コストのもとで、本手法はIWAE-DReGよりも優れた密度モデルを生成し、優れた計算量対精度のトレードオフを示した。
  • $T=11$ の場合、MH-HMCはわずかに本手法を上回ったが、$T=5$ の場合、本手法がより優れた結果を示した。これは経路長に敏感であることを示唆している。
  • $K$ や $T$ を増加させることで、モデル性能が一貫して向上した。これは、より良い後部分布近似が、より正確な勾配推定に繋がることを確認した。
  • 本手法は、MNISTおよびOmniglotの両データセットで、周辺尤度推定の最先端の性能を達成した。AISに基づく尤度推定は、双方向モンテカルロ法を用いて妥当性が検証された。
  • 本手法は、メモリコストを増加させることなく、計算量対精度のトレードオフを効果的に実現でき、大規模な深層生成モデルに適した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。