[論文レビュー] Markovian Score Climbing: Variational Inference with KL(p||q)
本稿では、不変バイアスを有する不確実性勾配を用いて、包括的KLダイバージェンス $\mathrm{KL}(p \| q)$ を信頼性高く最小化する、新しい変分推論アルゴリズムであるマルコフ連鎖スコアクライミング(MSC)を提案する。MCMCサンプリングとスコア関数更新を組み合わせることで、リウェイトド・ウェイクスリープ やニューラル適応的SMCといった先行手法が直面する系統的バイアスに悩まされず、局所最適解に収束する。
Modern variational inference (VI) uses stochastic gradients to avoid intractable expectations, enabling large-scale probabilistic inference in complex models. VI posits a family of approximating distributions q and then finds the member of that family that is closest to the exact posterior p. Traditionally, VI algorithms minimize the "exclusive Kullback-Leibler (KL)" KL(q || p), often for computational convenience. Recent research, however, has also focused on the "inclusive KL" KL(p || q), which has good statistical properties that makes it more appropriate for certain inference problems. This paper develops a simple algorithm for reliably minimizing the inclusive KL using stochastic gradients with vanishing bias. This method, which we call Markovian score climbing (MSC), converges to a local optimum of the inclusive KL. It does not suffer from the systematic errors inherent in existing methods, such as Reweighted Wake-Sleep and Neural Adaptive Sequential Monte Carlo, which lead to bias in their final estimates. We illustrate convergence on a toy model and demonstrate the utility of MSC on Bayesian probit regression for classification as well as a stochastic volatility model for financial data.
研究の動機と目的
- 排他的KLダイバージェンス $\mathrm{KL}(q \| p)$ を最小化する伝統的変分推論の限界を解決する。これは事後分布の不確実性を低く見積もる。
- リウェイトド・ウェイクスリープ やニューラル適応的SMCといった、包括的KLダイバージェンス $\mathrm{KL}(p \| q)$ を標的とするが、バイアスを含む勾配を用いる既存手法に起因する系統的バイアスを克服する。
- 計算コストの増加を最小限に抑えつつ、不確実性勾配を用いて $\mathrm{KL}(p \| q)$ を最小化する信頼性があり収束性を保証するアルゴリズムを開発する。
- 合成モデルおよび実世界のモデルにおいて、MSCの収束性および事後分布近似の質の優位性を実証する。
提案手法
- ステーションナリィ分布が $p$ であるマルコフ連鎖からのサンプルを用いて勾配を推定する、確率的最適化手法としてのマルコフ連鎖スコアクライミング(MSC)を提案する。
- スコア関数 $\nabla_\lambda \log q(\mathbf{z}[k])$ を基に、ロビンズ・モンロのステップサイズスケジュールを用いて変分パラメータを更新する。
- MCMCカーネルを現在の変分近似に適応的に依存させることで、VIが収束するに従いMCMCの性能が段階的に向上することを可能にする。
- 勾配推定のためのサンプル生成に、条件付き重要度サンプリング(CIS)または条件付き逐次モンテカルロ(CSMC)をMCMCカーネルとして活用する。
- 重要度サンプリングによるバイアスを避けるために、変分提案分布のスコア関数を用いることで、勾配推定が不確実性を伴わないことを保証する。
- $\mathrm{KL}(p \| q)$ の局所最適解に確実に収束する、理論的収束性を保証する確率的最適化フレームワークに本手法を統合する。
実験結果
リサーチクエスチョン
- RQ1不確実性勾配を用いて、包括的KLダイバージェンス $\mathrm{KL}(p \| q)$ を不確実性を伴わず最小化できる変分推論アルゴリズムは存在するか?
- RQ2リウェイトド・ウェイクスリープ やニューラル適応的SMCといった既存手法は、$\mathrm{KL}(p \| q)$ を標的としているにもかかわらず、なぜバイアスを含む事後分布近似を生じるのか?
- RQ3ISベースおよびSMCベースの手法と比較して、MSCは収束性および周辺尤度推定においてどのように異なるか?
- RQ4不確実性の低減が既知の問題であるモデルにおいて、MSCはより頑健な事後分布近似を提供できるか?
- RQ5ファイナンシャルタイムシリーズモデリングのような実世界の応用において、MSCはSMCベースの最適化を上回る性能を示せるか?
主な発見
- MSCは、サブオプティマルな解に収束するバイアスを伴う手法とは異なり、包括的KLダイバージェンス $\mathrm{KL}(p \| q)$ の局所最適解に収束する。
- トロイ・スキュー・ノーマルモデルにおいて、MSCはリウェイトド・ウェイクスリープ やニューラル適応的SMCが観察する系統的バイアスを回避し、常に事後分散を低く見積もる傾向を示さない。
- ベイジアンプロビット回帰において、MSCはISベースの最適化よりも優れた周辺尤度推定を達成し、ベンチマークデータセットではEPの性能を同等または上回る。
- 18の為替レートデータセットにおいて、MSCは[22]のSMCベース手法よりも顕著に高い対数周辺尤度を達成した(評価には $S=10,000$、$S=10$ の粒子数を用いた)。
- MSCは粒子数 $S$ の選択に対して頑健であり、ハートおよびイオノスデータセットでは、異なる $S$ に対しても類似した平均値に収束するが、IS手法は $S$ が小さい場合に顕著なバイアスを示す。
- 複数のモデルにおいて一貫した性能を示し、特に確率的ボラティリティモデルにおいても、MSCはSMCベースの最適化を周辺尤度推定の観点で上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。