Skip to main content
QUICK REVIEW

[論文レビュー] Multilevel Monte Carlo for Scalable Bayesian Computations

Michael B. Giles, Tigran Nagapetyan|arXiv (Cornell University)|Sep 15, 2016
Markov Chains and Monte Carlo Methods参考文献 15被引用数 5
ひとこと要約

本稿では、標準MCMCの最適な $Ø(c^{-1/2})$ 収束速度を達成すると同時にSGLDのスケーラビリティを維持する、新しいアルゴリズムであるマルチレベル確率的勾配ランジュバンダイナミクス(ML-SGLD)を提案する。アンチシティック結合、テイラーに基づく確率的勾配、パス平均化を組み合わせることで、分散を低減し、データセットサイズに伴う非線形な計算コストスケーリングを実現し、標準SGLDを上回り、メトロポリス・ハスティングス補正を必要としないMCMCの効率性に匹敵する。

ABSTRACT

Markov chain Monte Carlo (MCMC) algorithms are ubiquitous in Bayesian computations. However, they need to access the full data set in order to evaluate the posterior density at every step of the algorithm. This results in a great computational burden in big data applications. In contrast to MCMC methods, Stochastic Gradient MCMC (SGMCMC) algorithms such as the Stochastic Gradient Langevin Dynamics (SGLD) only require access to a batch of the data set at every step. This drastically improves the computational performance and scales well to large data sets. However, the difficulty with SGMCMC algorithms comes from the sensitivity to its parameters which are notoriously difficult to tune. Moreover, the Root Mean Square Error (RMSE) scales as $\mathcal{O}(c^{-\frac{1}{3}})$ as opposed to standard MCMC $\mathcal{O}(c^{-\frac{1}{2}})$ where $c$ is the computational cost. We introduce a new class of Multilevel Stochastic Gradient Markov chain Monte Carlo algorithms that are able to mitigate the problem of tuning the step size and more importantly of recovering the $\mathcal{O}(c^{-\frac{1}{2}})$ convergence of standard Markov Chain Monte Carlo methods without the need to introduce Metropolis-Hasting steps. A further advantage of this new class of algorithms is that it can easily be parallelised over a heterogeneous computer architecture. We illustrate our methodology using Bayesian logistic regression and provide numerical evidence that for a prescribed relative RMSE the computational cost is sublinear in the number of data items.

研究の動機と目的

  • 標準的な確率的勾配MCMC(SGMCMC)手法における $Ø(c^{-1/3})$ の不良な収束速度を是正すること。これは、スケーラビリティは保証されるが精度に制限をもたらす。
  • メトロポリス・ハスティングス補正を必要とせず、標準MCMCの $Ø(c^{-1/2})$ 収束速度を回復する、SGLDのためのマルチレベルモンテカルロフレームワークを開発すること。
  • テイラーに基づく確率的勾配と効率的なパス結合を用いて、データサイズ $N$ に対して非線形な計算コストスケーリングを実現すること。
  • アンチシティック結合と時間平均化推定器を用いて、数値的安定性を向上させ、分散を低減することで、実用的性能を向上させること。

提案手法

  • 粗いパスと細かいパスを結合するための、段階的な減少するステップサイズ $h_l = 2^{-l}$ を用いたマルチレベルSGLDフレームワークを提案する。
  • 段階間のアンチシティック結合を用いて、パス差の分散を低減し、分散の $Ø(h_l^2)$ 減衰を達成する。これは、標準的結合の $Ø(h_l)$ 減衰を上回る。
  • 勾配評価の計算コストを低減するため、スコア関数のテイラー近似を導入し、$N$ に伴う非線形スケーリングを可能にする。
  • 各段階においてサンプルの時間平均化を適用することで、収束速度に影響を与えずに分散をさらに低減する。
  • 各段階で結合パスに基づく制御変数戦略を用いて、事後期待値の推定分散を低減する。
  • 各段階における平均増分と分散の数値的収束に基づく停止基準を採用し、適応的計算を可能にする。

実験結果

リサーチクエスチョン

  • RQ1マルチレベルモンテカルロ技術をSGLDと効果的に組み合わせることで、標準MCMCの $Ø(c^{-1/2})$ 収束速度を回復できるか?
  • RQ2マルチレベルSGLDフレームワークにおけるアンチシティック結合が、先行研究のMLMC手法に見られる対数的コスト項を排除できるか?
  • RQ3テイラーに基づく確率的勾配が、データポイント数 $N$ に対して非線形な計算コストスケーリングを実現できるか?
  • RQ4アンチシティック結合、テイラー近似、パス平均化の組み合わせが、分散の減衰率と全体の計算複雑度にどのように影響するか?
  • RQ5ML-SGLDが、大規模ベイズ推論において、顕著に低い計算コストでMCMCレベルの精度に到達できるか、その程度はいかほどか?

主な発見

  • テイラーに基づく勾配を用いたアンチシティックMLSGLDは、標準MCMCと同等の $Ø(c^{-1/2})$ 収束速度を達成し、スケーラビリティを維持する。
  • 数値実験の結果、計算コストがデータポイント数 $N$ に対して非線形に増加することが示された。特に、アンチシティック変種とテイラー近似を組み合わせた場合に顕著である。
  • パス差の分散減衰率は $Ø(h_l^2)$ に達し、標準的結合の $Ø(h_l)$ 減衰を著しく上回り、各段階における必要なサンプル数を削減する。
  • アンチシティック結合、テイラー近似、パス平均化の組み合わせにより、分散の乗数定数が低減され、ベースラインML-SGLDよりも優れた全体の複雑度が得られる。
  • 相対的平均二乗誤差が $2^{-5}$ の場合、最良のML-SGLDバージョンの計算コストは $N$ に対して非線形にスケーリングするが、MALA(MCMC)のコストは $N$ に対して線形にスケーリングする。
  • アルゴリズムは段階およびパス間で自然に並列化可能であり、異種アーキテクチャ上でも効率的な実装を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。