[論文レビュー] Distributed Bayesian Learning with Stochastic Natural-gradient Expectation Propagation and the Posterior Server
本稿では、確率的自然勾配とモンテカルロサンプリングを用いて事後分布を近似する、収束性を保証するブラックボックス変分ベイズ推論手法であるStochastic Natural Gradient Expectation Propagation (SNEP) を提案する。さらに、SNEPを介してモーメントベースのメッセージを同期することで、クラスタ全体にわたるスケーラブルで分散型のベイズ学習を可能にする「ポストリアルサーバー」アーキテクチャを提案し、通信オーバーヘッドを最小限に抑えてロジスティック回帰および深層ニューラルネットワークにおいて有効性を示している。
This paper makes two contributions to Bayesian machine learning algorithms. Firstly, we propose stochastic natural gradient expectation propagation (SNEP), a novel alternative to expectation propagation (EP), a popular variational inference algorithm. SNEP is a black box variational algorithm, in that it does not require any simplifying assumptions on the distribution of interest, beyond the existence of some Monte Carlo sampler for estimating the moments of the EP tilted distributions. Further, as opposed to EP which has no guarantee of convergence, SNEP can be shown to be convergent, even when using Monte Carlo moment estimates. Secondly, we propose a novel architecture for distributed Bayesian learning which we call the posterior server. The posterior server allows scalable and robust Bayesian learning in cases where a data set is stored in a distributed manner across a cluster, with each compute node containing a disjoint subset of data. An independent Monte Carlo sampler is run on each compute node, with direct access only to the local data subset, but which targets an approximation to the global posterior distribution given all data across the whole cluster. This is achieved by using a distributed asynchronous implementation of SNEP to pass messages across the cluster. We demonstrate SNEP and the posterior server on distributed Bayesian learning of logistic regression and neural networks. Keywords: Distributed Learning, Large Scale Learning, Deep Learning, Bayesian Learn- ing, Variational Inference, Expectation Propagation, Stochastic Approximation, Natural Gradient, Markov chain Monte Carlo, Parameter Server, Posterior Server.
研究の動機と目的
- 事後分布に対する簡略化仮定を必要とせず、収束性を保証するブラックボックス変分ベイズ推論アルゴリズムの開発。
- データがクラスタに分散配置されている状況において、各ノードが局所的なデータサブセットのみを処理する条件下で、スケーラブルで頑健な分散型ベイズ学習を可能にすること。
- 従来の期待値伝搬(EP)における収束不能問題を克服するため、確率的自然勾配の定式化を導入すること。
- 局所的なMCMCサンプラーをモーメント共有を通じて調整するポストリアルサーバーを用いて、通信効率の高い分散型学習システムを設計すること。
- 大規模モデル、特にロジスティック回帰および深層ニューラルネットワークに対して、分散データを用いて本手法の有効性を示すこと。
提案手法
- 傾き付き分布のモーメントのモンテカルロ推定を用いる期待値伝搬の確率的自然勾配変種であるSNEPを提案する。
- 局所的な事後分布近似からのサンプリングを効率的に行うために、適応的質量行列(Adamにインspired)を用いた確率的勾配ランジュヴィアンダイナミクス(SGLD)を採用する。
- 全ワーカーにグローバルなモーメント更新(θ−i)を集約・ブロードキャストするポストリアルサーバーを導入し、局所的な事後分布近似の同期を実現する。
- 各通信後にMCMCチェーンの効率を維持するために、MCMCステートを新しいターゲット分布に対して再位置づけする「ステートシフト」技術を導入する。
- 局所データのミニバッチから得られる不偏な確率的勾配を用いて、変分パラメータに対する自然勾配更新を実施する。
- 通信頻度を最小限に抑えつつ、耐障害性を確保するため、SNEPの分散非同期実装を採用し、クラスタ間でのメッセージ伝達を実現する。
実験結果
リサーチクエスチョン
- RQ1モンテカルロによる傾き付き分布のモーメント推定を用いる場合でも、EPの確率的自然勾配定式化が収束性を保証できるか?
- RQ2データがクラスタに分散配置されている状況で、分散型ベイズ学習をどのようにスケーラブルかつ通信効率よく実現できるか?
- RQ3完全なデータ複製や頻回な通信なしに、ワーカー間で局所的なMCMCサンプラーを同期させることは可能か?
- RQ4ポストリアルサーバーのアーキテクチャが、大規模ベイズモデルにおける正確で効率的な事後分布近似を可能にするか?
- RQ5SNEPは、分散データを用いた複雑なモデル、例えば深層ニューラルネットワークにおいても収束性と性能を維持できるか?
主な発見
- SNEPは、わずかな条件下でも、傾き付き分布のノイズの大きいモンテカルロ推定を用いても、証明可能な収束性を有する。
- ポストリアルサーバーにより、通信頻度が低く、モーメントのみを共有するため、通信量を最小限に抑えた分散型ベイズ学習が可能である。
- ステートシフト技術により、通信後にMCMCサンプラーが効率的に再開可能となり、バーンイン期間の必要がなくなる。
- 分散データと局所的サンプリングを前提としても、ロジスティック回帰および深層ニューラルネットワークにおいて、中央集権的推論と同等の事後分布近似精度を達成している。
- 対角質量行列とデバイアス補正(Adamに類似)を用いた適応的SGLDは、トレーニングの安定性と収束速度を著しく向上させる。
- 実験結果から、本手法は大規模データセットに対しても効果的にスケーリング可能であり、データ分割や通信遅延に対しても頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。