Skip to main content
QUICK REVIEW

[論文レビュー] Does Hamiltonian Monte Carlo mix faster than a random walk on multimodal densities?

Oren Mangoubi, Natesh S. Pillai|arXiv (Cornell University)|Aug 9, 2018
Markov Chains and Monte Carlo Methods参考文献 30被引用数 16
ひとこと要約

本稿では、ハミルトニアン・モンテカルロ(HMC)が高次元の多重モード標本分布に対してランダムウォーク・メトロポリス(RWM)を上回るかを調査し、HMCに根本的な利点がないことが判明した。リウヴィルの定理に基づく新しいコンダクタンスの公式を用いて、分散が小さいガウス混合分布における両手法のスペクトルギャップを計算したところ、$ \sigma \to 0 $ のとき、両者とも同じ $ e^{-\frac{1}{2}\sigma^{-2}} $ の減少率を示した。これは、HMCとRWMがこの領域で漸近的に同等の混合時間を持つことを示唆しており、HMCの勾配に基づく提案がモード間で効果を発揮できないにもかかわらずである。

ABSTRACT

Hamiltonian Monte Carlo (HMC) is a very popular and generic collection of Markov chain Monte Carlo (MCMC) algorithms. One explanation for the popularity of HMC algorithms is their excellent performance as the dimension $d$ of the target becomes large: under conditions that are satisfied for many common statistical models, optimally-tuned HMC algorithms have a running time that scales like $d^{0.25}$. In stark contrast, the running time of the usual Random-Walk Metropolis (RWM) algorithm, optimally tuned, scales like $d$. This superior scaling of the HMC algorithm with dimension is attributed to the fact that it, unlike RWM, incorporates the gradient information in the proposal distribution. In this paper, we investigate a different scaling question: does HMC beat RWM for highly $ extit{multimodal}$ targets? We find that the answer is often $ extit{no}$. We compute the spectral gaps for both the algorithms for a specific class of multimodal target densities, and show that they are identical. The key reason is that, within one mode, the gradient is effectively ignorant about other modes, thus negating the advantage the HMC algorithm enjoys in unimodal targets. We also give heuristic arguments suggesting that the above observation may hold quite generally. Our main tool for answering this question is a novel simple formula for the conductance of HMC using Liouville's theorem. This result allows us to compute the spectral gap of HMC algorithms, for both the classical HMC with isotropic momentum and the recent Riemannian HMC, for multimodal targets.

研究の動機と目的

  • ハミルトニアン・モンテカルロ(HMC)が、高次元の多重モード標本分布において、ランダムウォーク・メトロポリス(RWM)よりも速く混合するかどうかを検証すること。
  • モードが分離された状況において、HMCの勾配に基づく提案が、意味的な利点を提供するかどうかを評価すること。
  • HMCのスペクトルギャップを多重モードの標本分布に対して計算するための一般的な手法を、新しいコンダクタンスの公式を用いて開発すること。
  • HMCの性能が、多重モード領域におけるチューニングパラメータの変化に対してどれほど頑健であるかを評価すること。
  • HMCが、高次元または多重モードの文脈において、RWMを常に上回るとの一般的な仮定に疑問を呈すること。

提案手法

  • リウヴィルの定理を応用して、HMCのコンダクタンスを求める新しい公式を導出し、多重モードの標本分布におけるスペクトルギャップの正確な計算を可能にする。
  • 代表的な多重モード例として、二つのガウス分布の混合 $ \frac{1}{2}N(-1,\sigma^2) + \frac{1}{2}N(1,\sigma^2) $ にその公式を適用する。
  • 最適チューニング下で、HMC(等方的およびリーマン計量を用いる)とRWMの両者について、積分時間 $ T \propto \sigma $ および提案分散 $ \propto \sigma^2 $ のもとでスペクトルギャップを計算する。
  • チーリングの不等式を用いてコンダクタンスとスペクトルギャップの関係を確立し、混合時間の性能に上限を設ける。
  • スペクトルギャップの $ \sigma \to 0 $ における漸近的挙動を分析し、両手法が同じ減少率を示すことを示す。
  • HMCの積分時間 $ T $ を延ばしても、コンダクタンスの向上は線形的であることが示され、性能向上の限界が生じることを示す。

実験結果

リサーチクエスチョン

  • RQ1HMCは、特にモードが明確に分離された場合に、多重モードの標本分布においてRWMよりも速く混合するのか?
  • RQ2HMCの提案における勾配情報は、離れたモード間を効果的に遷移可能か?
  • RQ3モード間の分離が広がる(すなわち $ \sigma \to 0 $)際、HMCとRWMのスペクトルギャップの漸近的挙動はいかなるものか?
  • RQ4最適チューニング下でも、HMCは多重モード領域において根本的な性能限界に達するのか?
  • RQ5積分時間 $ T $ を無限に増やすことでHMCのコンダクタンスを無限に改善できるのか、それとも限界効果が現れるのか?

主な発見

  • 分散 $ \sigma $ が小さい二つのガウス分布の混合において、HMCとRWMの両者とも $ \sigma \to 0 $ のとき、スペクトルギャップが $ e^{-\frac{1}{2}\sigma^{-2}} $ の割合で減少する。
  • 等方的モーメンタムを用いたHMCおよびリーマンHMCのスペクトルギャップは、RWMと同一の減少率を示し、この領域ではHMCに混合の利点がないことを示している。
  • HMCのコンダクタンスは、積分時間 $ T $ に対して高々線形に増加するため、性能向上の限界があり、多重モードの障壁を克服できない。
  • 最適チューニング下でも、HMCはRWMに対する相対的性能を向上させることができず、勾配がモード間で効果を発揮しないからである。
  • RWMは、より良いチューニング(例:$ \epsilon \propto \sigma $)により著しい性能向上を達成できるが、HMCは同様の向上を示さないため、チューニングの特性に顕著な差が生じる。
  • コンダクタンスの上限 $ \Phi(K_T) \leq T \cdot \Phi_0(\pi) $ は、HMCの有効な混合速度が、標本分布の基本的な幾何構造によって根本的に制限されることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。