[論文レビュー] Overdispersed Black-Box Variational Inference
本稿では、事後分布と同一指数型分布族に属する過分散分布からの重要度抽出を用いることで、ブラックボックス変分推論(o-BBVI)の勾配分散を低減する手法を提案する。標準的BBVIですら、半分のサンプル数でさえも下回る低い分散を達成でき、確率的最適化における収束速度が向上する。
We introduce overdispersed black-box variational inference, a method to reduce the variance of the Monte Carlo estimator of the gradient in black-box variational inference. Instead of taking samples from the variational distribution, we use importance sampling to take samples from an overdispersed distribution in the same exponential family as the variational approximation. Our approach is general since it can be readily applied to any exponential family distribution, which is the typical choice for the variational approximation. We run experiments on two non-conjugate probabilistic models to show that our method effectively reduces the variance, and the overhead introduced by the computation of the proposal parameters and the importance weights is negligible. We find that our overdispersed importance sampling scheme provides lower variance than black-box variational inference, even when the latter uses twice the number of samples. This results in faster convergence of the black-box inference procedure.
研究の動機と目的
- ブラックボックス変分推論(BBVI)におけるモンテカルロ勾配推定器の高分散を是正すること。これは最適化の収束を遅くする要因である。
- 再パラメータライゼーションやモデル固有の仮定に依存しない、一般化された手法を構築すること。
- 事後分布をよりよく捉えるために、事後分布よりも尾が重い分布を提案分布として構築することで、BBVIの効率を向上させること。
- 計算コストの増加が著しくないままに分散低減を達成できることを示し、複雑なモデルに対しても実用的であることを確認すること。
- 平均場型および構造的推論、および確率的プログラミングと互換性を持つ統一的なフレームワークを提供すること。
提案手法
- BBVIにおける勾配推定に重要度抽出を用い、事後分布と同一指数型分布族に属する過分散分布からサンプルを抽出する。
- 指数型分布族の分散パラメータτを調整することで提案分布を構築する:パラメータλの分布に対して、提案分布はλ/τおよび1/τにスケーリングされた形状パラメータを用いる。
- ガンマ分布の場合、過分散版は形状(s + τ - 1)/τ、尺度r/τとなる。ポアソン分布の場合は、ポアソン(λ^{1/τ})となる。
- 重要度重みは、元の事後分布密度と過分散提案分布密度の比を用いて計算する。
- 本手法は完全にブラックボックスである:対数結合分布p(x,z)、対数事後分布q(z;λ)、およびスコア関数∇λ log q(z;λ) のみが必要となる。
- 制御変数やRao-Blackwellizationといった既存の分散低減技術とも互換性があり、それらと組み合わせて使用可能である。
実験結果
リサーチクエスチョン
- RQ1過分散重要度抽出は、標準的BBVIと比較して、ブラックボックス変分推論における勾配推定器の分散をより効果的に低減できるか?
- RQ2顕著な分散低減を達成しつつ、計算コストの増加が著しくないか?
- RQ3o-BBVIは、BBVIがサンプル数を2倍にした場合と比較して、収束速度と推定精度の面で優れているか?
- RQ4o-BBVIは、再パラメータライゼーションや数値積分が困難な分布に対しても、一般に適用可能か?
- RQ5混合提案分布を用いることで、単一の過分散提案分布よりも安定性と性能が向上するか?
主な発見
- o-BBVIは、標準的BBVIですら2倍のサンプル数を用いる場合でさえも、はるかに低い勾配推定器の分散を達成する。
- 非共役時系列モデル(gn-ts)において、o-BBVIは図1aに示すように、BBVIが2倍のサンプル数を用いた場合よりも平均的サンプル分散が低い。
- ELBOおよび予測性能(ホールドアウト尤度)の観点から、o-BBVIはgn-tsモデルにおいて標準的BBVIを上回る。図1bおよび1cで示されている。
- ポアソンベースのディープ指数型分布(DEF)モデルにおいても、o-BBVIはBBVIよりも低い分散と、より優れたELBOおよびパープレキシティ性能を示す。2成分混合提案分布は単一の提案分布よりもわずかに優れた安定性を示す。
- 初期段階の最適化において、o-BBVIはガウス変数に対して数値積分を用いるローカル期待値法よりも収束が速く、計算効率が優れていることが示唆される。
- ローカル期待値法は、形状パラメータが1未満のガンマ分布やポアソン分布では、原点における特異性のため失敗するが、本手法はそれらの分布に対しても有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。