Skip to main content
QUICK REVIEW

[論文レビュー] Perturbative Black Box Variational Inference

Robert Bamler, Cheng Zhang|arXiv (Cornell University)|Sep 21, 2017
Gaussian Processes and Bayesian Inference参考文献 20被引用数 7
ひとこと要約

本稿では、偏微分の次数 $K$ でインデックス付けられる新しい変分バウンディングの族、Perturbative Black Box Variational Inference (PBBVI) を提案する。この手法は、標準的なブラックボックス変分推論よりも勾配の分散を低減し、周辺尤度のバウンディングをタイトにすることで、改善を図る。$K=3$ の場合、PBBVI は KLVI や alpha-VI よりも優れた事後分布カバレッジと高いテスト尤度を達成し、より低い分散の勾配と高速な収束を実現する。

ABSTRACT

Black box variational inference (BBVI) with reparameterization gradients triggered the exploration of divergence measures other than the Kullback-Leibler (KL) divergence, such as alpha divergences. In this paper, we view BBVI with generalized divergences as a form of estimating the marginal likelihood via biased importance sampling. The choice of divergence determines a bias-variance trade-off between the tightness of a bound on the marginal likelihood (low bias) and the variance of its gradient estimators. Drawing on variational perturbation theory of statistical physics, we use these insights to construct a family of new variational bounds. Enumerated by an odd integer order $K$, this family captures the standard KL bound for $K=1$, and converges to the exact marginal likelihood as $K o\infty$. Compared to alpha-divergences, our reparameterization gradients have a lower variance. We show in experiments on Gaussian Processes and Variational Autoencoders that the new bounds are more mass covering, and that the resulting posterior covariances are closer to the true posterior and lead to higher likelihoods on held-out data.

研究の動機と目的

  • 再パラメータライゼーションを用いたブラックボックス変分推論における一般化ダイバージェンス、特に alpha-ダイバージェンスを用いた場合の高分散勾配推定器の問題に対処すること。
  • 統計物理学の摂動理論を活用して、バイアスと分散のバランスを取る新しい変分バウンディングの族を構築すること。
  • 再パラメータライゼーション勾配を低分散に保ちつつ、$K \to \infty$ の極限で真の周辺尤度に近づく手法を構築すること。
  • 既存手法(KLVI や alpha-VI)と比較して、新しいバウンディングがより優れた事後分布近似とより高い予測尤度を達成することを実証的に検証すること。

提案手法

  • 統計物理学における摂動理論に基づいて導出された、奇数の整数 $K$ でインデックス付けられる新しい変分下界 $\mathcal{L}^{(K)}(\lambda, V_0)$ を提案する。
  • このバウンディングは、$\log p(\mathbf{x}, \mathbf{z}) - \log q(\mathbf{z}; \lambda) + V_0$ の対数密度差の多項式展開($K$ 次まで)の、変分分布における期待値として表現される。
  • ステートフォーストック・グラディエント・ディセントによる効率的で低分散の最適化のため、再パラメータライゼーション勾配を用いる。
  • 柔軟性と近似品質の向上を図るため、データの関数としての学習可能な基準エネルギー $V_0$ を導入し、ニューラルネットワークでモデル化する。
  • ガウス過程と変分オートエンコーダーにこの手法を適用し、大規模データセットへのスケーリングを実現するため、アモアタイズド推論ネットワークを用いる。
  • 安定した収束を保証するため、エポックごとにデータをシャッフルし、バッチサイズ 20 のミニバッチを用いた訓練戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1摂動理論を用いて、勾配の分散を低減するとともに周辺尤度のバウンディングをタイトにする新しい変分バウンディングの族を導出できるか?
  • RQ2PBBVI の性能は、KLVI や alpha-VI と比較して、事後分布カバレッジと予測尤度の観点でどのように異なるか?
  • RQ3摂動次数 $K$ を増加させることで、近似品質と収束速度が体系的に向上するか?
  • RQ4ミニバッチ学習とアモアタイズド推論を用いることで、PBBVI バウンディングを大規模データセットに効果的にスケーリングできるか?

主な発見

  • $K=3$ の場合、PBBVI は特に小さな訓練データセットにおいて、KLVI や alpha-VI よりも真の事後分布質量をよりよくカバーする変分分布を生成する。
  • PBBVI は、すべての訓練データセットサイズにおいて、KLVI よりもホールドアウトされたテストデータにおける予測対数尤度が高く、特に小さなサブセットで最大の向上が観察される。
  • PBBVI の勾配推定器は、alpha-VI よりも著しく低い分散を示し、トレーニング中の収束が速い。
  • 訓練データセットサイズが増加するにつれて、PBBVI の性能は KLVI に近づく。これは理論的予想と整合的であり、$\mathbb{E}_{q^*}[(V_0^* - V)^3] = 0$ が成り立つと、大規模データの極限で KLVI に収束することが示唆される。
  • $K \to \infty$ の極限で、PBBVI バウンディングは真の周辺尤度に収束する。これは、真の事後分布との理論的整合性を示している。
  • 高次の $K$ における真の対数周辺尤度のタイトな近似により、PBBVI は変分EMにおけるハイパーパrameter最適化をより信頼性高く可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。