Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence of Langevin Monte Carlo: The Interplay between Tail Growth and Smoothness

Murat A. Erdogdu, Rasa Hosseinzadeh|arXiv (Cornell University)|May 27, 2020
Markov Chains and Monte Carlo Methods参考文献 58被引用数 20
ひとこと要約

本稿は、弱い滑らかさおよび尾部成長条件の下で、未調整ラングヴィン・モンテカルロ(LMC)アルゴリズムの収束速度を確立する。$\alpha$ 階の尾部成長($\alpha \in [1,2]$)と $\beta$-ホルダー連続勾配を持つポテンシャル関数に対して、LMCは KL 発散の $\epsilon$-精度に到達するまでに $\widetilde{\mathcal{O}}\big(d^{\frac{1}{\beta} + \frac{1+\beta}{\beta}(\frac{2}{\alpha} - \mathbbm{1}_{\{\alpha \neq 1\}})} \epsilon^{-\frac{1}{\beta}}\big)$ ステップを要する。主な洞察は、$\alpha \geq 1$ のとき、$\epsilon$-依存性が尾部成長 $\alpha$ に依存せず滑らかさ $\beta$ のみに依存することであり、これはリプシッツ連続勾配($\beta=1$)に対する既知の最良の収束率を、非凸ポテンシャルに対しても回復することを意味する。

ABSTRACT

We study sampling from a target distribution ${ν_* = e^{-f}}$ using the unadjusted Langevin Monte Carlo (LMC) algorithm. For any potential function $f$ whose tails behave like ${\|x\|^α}$ for ${α\in [1,2]}$, and has $β$-Hölder continuous gradient, we prove that ${\widetilde{\mathcal{O}} \Big(d^{\frac{1}β+\frac{1+β}β(\frac{2}α - \boldsymbol{1}_{\{α eq 1\}})} ε^{-\frac{1}β}\Big)}$ steps are sufficient to reach the $ε$-neighborhood of a $d$-dimensional target distribution $ν_*$ in KL-divergence. This convergence rate, in terms of $ε$ dependency, is not directly influenced by the tail growth rate $α$ of the potential function as long as its growth is at least linear, and it only relies on the order of smoothness $β$. One notable consequence of this result is that for potentials with Lipschitz gradient, i.e. $β=1$, our rate recovers the best known rate ${\widetilde{\mathcal{O}}(dε^{-1})}$ which was established for strongly convex potentials in terms of $ε$ dependency, but we show that the same rate is achievable for a wider class of potentials that are degenerately convex at infinity. The growth rate $α$ starts to have an effect on the established rate in high dimensions where $d$ is large; furthermore, it recovers the best-known dimension dependency when the tail growth of the potential is quadratic, i.e. ${α= 2}$, in the current setup. Our framework allows for finite perturbations, and any order of smoothness ${β\in(0,1]}$; consequently, our results are applicable to a wide class of non-convex potentials that are weakly smooth and exhibit at least linear tail growth.

研究の動機と目的

  • ポテンシャル関数に最小限の構造的仮定を課した場合の未調整ラングヴィン・モンテカルロ(LMC)の収束速度を確立すること。
  • 尾部成長率 $\alpha$ と勾配の滑らかさ $\beta$ が、高次元サンプリングにおける LMC の収束にどのように影響するかを分析すること。
  • 強凸または滑らかなポテンシャル関数に限らない、より広い非凸的・弱い滑らかさを持つ分布のクラスに、既知の収束保証を拡張すること。
  • 非対数凸ターゲットに対して、尾部挙動と滑らかさの相互作用を捉えることができる、モーメントに依存する修正ログソボレフ不等式(MLSI)フレームワークを構築すること。
  • $\beta=1$ の場合に $\widetilde{\mathcal{O}}(d\epsilon^{-1})$ の収束率が、無限遠における退化的凸ポテンシャルに対して、強凸の場合と同様に成り立つことを示すこと。

提案手法

  • 無限遠における凸的で退化的なポテンシャル関数と $\alpha$-成長尾部を持つターゲット分布に対して、明示的な定数を伴うモーメントに依存する修正ログソボレフ不等式を証明すること。
  • LMC マルコフ連鎖に対して、$\alpha$-発散性条件の下で線形に発散するモーメント推定を確立し、モーメントの増加と収束速度の関係を結びつけること。
  • モーメント推定から導かれる微分不等式を用い、反復的に適用することで、LMCの分布とターゲット分布の間の KL 発散を制御すること。
  • モーメントの順序を調整して、モーメント増加と収束のトレードオフをバランスさせ、KL 誤差のタイトな制御を可能にすること。
  • ホリー・ストルックの摂動補題を適用して、凸ポテンシャルの有限摂動に対しても結果を拡張し、非凸ターゲットへの適用範囲を広げること。
  • タラガンダンの不等式と相対的フィッシャー情報量を用いて、KL 発散と Wasserstein 距離の関係を確立し、複数の距離尺度における収束解析を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1ポテンシャル関数の尾部成長率 $\alpha$ は、高次元における未調整 LMC の収束速度にどのように影響するか?
  • RQ2$\beta=1$ の場合に知られている $\widetilde{\mathcal{O}}(d\epsilon^{-1})$ の収束速度は、線形尾部成長($\alpha \geq 1$)を持つ非凸ポテンシャルへと拡張可能か?
  • RQ3滑らかさの順序 $\beta$ と尾部成長 $\alpha$ の間の相互作用は、LMC 収束速度の $\epsilon$-依存性を決定づけるか?
  • RQ4非対数凸ターゲットに対して、LMC の挙動を捉えることができる、モーメントに依存する修正ログソボレフ不等式を導出可能か?
  • RQ5収束速度は、特に $\alpha=2$ のとき、尾部成長構造を反映するように次元 $d$ に依存するか?

主な発見

  • 尾部が $\alpha$-成長($\alpha \in [1,2]$)で、勾配が $\beta$-ホルダー連続であるポテンシャル関数に対して、LMC の KL 発散における収束速度は $\widetilde{\mathcal{O}}\big(d^{\frac{1}{\beta} + \frac{1+\beta}{\beta}(\frac{2}{\alpha} - \mathbbm{1}_{\{\alpha \neq 1\}})} \epsilon^{-\frac{1}{\beta}}\big)$ である。
  • $\alpha \geq 1$ のとき、収束速度の $\epsilon$-依存性は尾部成長率 $\alpha$ に依存せず、滑らかさの順序 $\beta$ のみに依存する。これは、$\beta=1$ の場合に既知の最良の収束率を非凸ポテンシャルへと一般化することを意味する。
  • $\alpha=2$ のとき、次元依存性は $\beta=1$ の場合に知られている最良の $\widetilde{\mathcal{O}}(d\epsilon^{-1})$ の収束率に回復する。これは、無限遠で退化的凸である場合でも成り立つ。
  • 明示的な定数を伴う、モーメントに依存する修正ログソボレフ不等式が確立され、弱い仮定の下での収束速度の導出を可能にする。
  • このフレームワークは任意の $\beta \in (0,1]$ に適用可能であり、非リプシッツ連続勾配に対しても適用可能であり、凸ポテンシャルの有限摂動に対しても成立するため、広範な非凸ターゲットをカバーする。
  • 結果は LMC の最終反復に対してタイトであり、高次元・非対数凸サンプリングにおける最適収束を達成するには、高階のモーメント制御が不可欠であることを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。