[論文レビュー] Learning Deep Generative Models with Doubly Stochastic MCMC
本稿では、深層生成モデル(DGM)における近似ベイズ推論のための、二重確率的勾配MCMCを提案する。この手法は、ミニバッチの確率的勾配推定と、ニューラル適応的重要度サンプリング(NAIS)を組み合わせることで、扱いにくい事後分布の期待値を効率的に近似する。このアプローチは、複数のDGMアーキテクチャにおいて、密度推定、生成、欠損データ補完の分野で最先端の性能を達成した。
We present doubly stochastic gradient MCMC, a simple and generic method for (approximate) Bayesian inference of deep generative models (DGMs) in a collapsed continuous parameter space. At each MCMC sampling step, the algorithm randomly draws a mini-batch of data samples to estimate the gradient of log-posterior and further estimates the intractable expectation over hidden variables via a neural adaptive importance sampler, where the proposal distribution is parameterized by a deep neural network and learnt jointly. We demonstrate the effectiveness on learning various DGMs in a wide range of tasks, including density estimation, data generation and missing data imputation. Our method outperforms many state-of-the-art competitors.
研究の動機と目的
- ベイズ枠組み下での深層生成モデル(DGM)における扱いにくい事後分布推論の課題に取り組む。
- 高次元連続パrameter空間におけるサンプリング効率と勾配推定の精度を向上させる。
- 離散および連続の隠れ変数を併用するDGMにおいて、スケーラブルな近似ベイズ学習を可能にする。
- 複雑な事後分布構造に適応する汎用的かつトレーニング可能なプロポーザル機構を構築する。
- 密度推定、生成、補完タスクにおいて、既存の変分的手法およびMCMC手法を上回る性能を発揮する。
提案手法
- ミニバッチデータのサンプリングと隠れ変数の確率的サンプリングという2つの確率的要因を持つ、確率的勾配MCMC(SGMCMC)を採用する。
- 隠れ変数のプロポーザル分布をパrameter化するため、認識ネットワークを備えたニューラル適応的重要度サンプリング(NAIS)を用いる。
- プロポーザルと真の事後分布との包括的KLダイバージェンスを最小化することで、NAISプロポーザルを学習する。
- ミニバッチ勾配推定と重要度サンプリングを組み合わせ、連続パrameter空間における漸近的に不偏な勾配推定を構築する。
- 冷却率を用いたアニーリングを施したSGMCMCフレームワーク(例:DSGNHT)を適用し、目的事後分布への収束を保証する。
- プロポーザル分布の学習に、IWAEと同一の目的関数を用いることで、効果的な勾配最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1二重確率的MCMC手法は、既存のMCMCおよび変分的手法に比べ、DGMにおいてより優れたスケーラビリティと精度を達成できるか?
- RQ2ニューラル適応的重要度サンプリングは、高次元DGMにおける従来のギブスサンプリングの代替として、どの程度効果的か?
- RQ3ミニバッチデータ推定と確率的隠れ変数サンプリングを組み合わせることで、不偏かつ効率的な事後分布推論が達成できるか?
- RQ4提案手法は、離散および連続の隠れ変数を有するさまざまなDGMアーキテクチャに一般化可能か?
- RQ5密度推定、データ生成、欠損データ補完タスクにおいて、この手法はどの程度性能を向上させるか?
主な発見
- バイナリ化MNISTデータセットでは、DSGNHT-NAISがテスト時の対数尤度-86.93を達成し、VAE(-88.83)とIWAE(-87.63)を上回った。
- Omniglotデータセットでは、DSGNHT-NAISがテスト時の対数尤度-106.10を達成し、IWAEや他の強力なベースラインと同等またはそれを上回った。
- Caltech 101シルエットデータセットでは、NADE/NADE 150を用いたDSGNHT-NAISがテスト時の対数尤度-100.0を達成し、RWSに比べ4.3ナツの改善を示した。
- 重要度サンプル数をM=1からM=100に増加させたことで、テスト時の対数尤度は-105.3から-100.0に改善し、事後分布の平均推定の利点を示した。
- SBN/SBN 300-100-50-10において、DSGNHT-NAISはテスト時の対数尤度-103.6を達成し、RWSや他の競合手法を上回る最先端の性能を発揮した。
- ニューラル適応的重要度サンプリング(NAIS)は、ギブスサンプリングに比べて著しくサンプリング効率を向上させ、高次元空間における高速な混合を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。