Skip to main content
QUICK REVIEW

[論文レビュー] Pathfinder: Parallel quasi-Newton variational inference

Lu Zhang, Bob Carpenter|arXiv (Cornell University)|Aug 9, 2021
Probabilistic and Robust Engineering Design参考文献 51被引用数 18
ひとこと要約

Pathfinderは、逆ヘシアン推定値を用いた共分散に基づく正規近似を生成するための並列変分推論アルゴリズムであり、準ニュートン最適化経路を用いて複雑な事後分布の近似を実現する。1~2桁少ない対数密度および勾配評価回数で、短いハミルトニアンモンテカルロ(HMC)チェインと同等の性能を達成する一方で、マルチコアシステムにおけるスケーリングを実現するための並列ELBO評価を可能にする。

ABSTRACT

We propose Pathfinder, a variational method for approximately sampling from differentiable log densities. Starting from a random initialization, Pathfinder locates normal approximations to the target density along a quasi-Newton optimization path, with local covariance estimated using the inverse Hessian estimates produced by the optimizer. Pathfinder returns draws from the approximation with the lowest estimated Kullback-Leibler (KL) divergence to the true posterior. We evaluate Pathfinder on a wide range of posterior distributions, demonstrating that its approximate draws are better than those from automatic differentiation variational inference (ADVI) and comparable to those produced by short chains of dynamic Hamiltonian Monte Carlo (HMC), as measured by 1-Wasserstein distance. Compared to ADVI and short dynamic HMC runs, Pathfinder requires one to two orders of magnitude fewer log density and gradient evaluations, with greater reductions for more challenging posteriors. Importance resampling over multiple runs of Pathfinder improves the diversity of approximate draws, reducing 1-Wasserstein distance further and providing a measure of robustness to optimization failures on plateaus, saddle points, or in minor modes. The Monte Carlo KL divergence estimates are embarrassingly parallelizable in the core Pathfinder algorithm, as are multiple runs in the resampling version, further increasing Pathfinder's speed advantage with multiple cores.

研究の動機と目的

  • 既存の手法よりも精度と効率性に優れたスケーラブルで頑健な変分推論手法の開発。
  • L-BFGS最適化経路からの曲率情報を利用し、複雑な事後分布に対する高品質な正規近似を構築すること。
  • 標準的なVIにおける逐次的ボトル neck を回避するため、最適化経路上の複数点におけるEvidence Lower Bound(ELBO)の並列評価を可能にすること。
  • 複数回のPathfinderランにおける重要度再サンプリングにより、近似サンプルの多様性と初期化や局所最適解への感受性の低減を実現すること。
  • 特にハミルトニアンモンテカルロおよび適応メトロポリスサンプラーにおいて、MCMCのウォームアップ段階の高速かつ即時の代替手段としての提供。

提案手法

  • Pathfinderは、ランダムな初期化から出発し、事後分布の尾からモードへと至るL-BFGSを用いた準ニュートン最適化経路を生成する。
  • 最適化経路上で、局所的な逆ヘシアン推定値を共分散行列として用いた正規近似を評価する。
  • 各正規近似について、並列にELBOを計算し、真の事後分布とのKLダイバージェンスの推定値が最小となるものを選択する。
  • 複数の独立したPathfinderランにおける重要度再サンプリングを用いることで、サンプルの多様性と最適化失敗に対する頑健性を向上させる。
  • 再サンプリングプロセスの安定化と事後分布近似品質の向上のため、Pareto smoothed importance sampling(PSIS)を用いる。
  • コアの並列処理が容易なアルゴリズムであり、最適化経路上の異なる点におけるELBO評価はすべて独立しており、複数コアに分散可能である。

実験結果

リサーチクエスチョン

  • RQ1準ニュートン最適化経路を用いて、複雑な事後分布に対する高品質な正規近似を生成できるか?
  • RQ2最適化経路上でのELBOの並列評価は、逐次的VIと比較して計算効率を顕著に向上させるか?
  • RQ31-Wasserstein距離の観点から、Pathfinderの性能はADVIおよび短いHMCチェインと比較してどうか?
  • RQ4複数回のPathfinderランにおける重要度再サンプリングは、サンプルの多様性と初期化や局所最適解への感受性の低減を実現できるか?
  • RQ5Pathfinderは、ハミルトニアンモンテカルロおよび適応メトロポリスサンプラーにおけるMCMCウォームアップ段階の効果的かつ効率的な代替手段として機能できるか?

主な発見

  • Pathfinderは、短いダイナミックハミルトニアンモンテカルロチェインと同等の1-Wasserstein距離を達成しており、高品質な事後分布近似を実現していることが示された。
  • 特に挑戦的な事後分布において、ADVIおよび短いHMCと比較して、対数密度および勾配評価回数が1~2桁少ない。
  • 並列ELBO評価により、マルチコアシステムで顕著な高速化が達成され、モデルが複雑になるほど性能向上が顕著になる。
  • 複数回のPathfinderランにおける重要度再サンプリングにより、1-Wasserstein距離がさらに低減され、平坦な領域や小さなモードにおける最適化失敗に対する頑健性が向上した。
  • L-BFGSからの逆ヘシアン推定値は、MCMCの適応に有用な初期共分散行列を提供することができ、低次元モデルではStanの2番目のウォームアップ段階を回避する可能性を示した。
  • スケール拡張再初期化を組み合わせることで、初期化が悪くても頑健であり、複数の事後分布モードの探索が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。