Skip to main content
QUICK REVIEW

[論文レビュー] Smoothed Gradients for Stochastic Variational Inference

Stephan Mandt, David M. Blei|arXiv (Cornell University)|Jun 13, 2014
Gaussian Processes and Bayesian Inference参考文献 18被引用数 10
ひとこと要約

本稿では、分散を低減するために、不偏な自然勾配を固定ウィンドウ型移動平均による過去の十分統計量に置き換えることで、確率的変分ベイズ推論(SVI)における滑らかな勾配を提案する。この手法は、ストレージコストを定数倍にしか増加させない一方で、標準的なSVIよりも収束が速く、予測尤度が優れている。特に中程度のウィンドウサイズ(L=10–100)では、バイアスと分散の最適なトレードオフが達成され、優れた性能を発揮する。

ABSTRACT

Stochastic variational inference (SVI) lets us scale up Bayesian computation to massive data. It uses stochastic optimization to fit a variational distribution, following easy-to-compute noisy natural gradients. As with most traditional stochastic optimization methods, SVI takes precautions to use unbiased stochastic gradients whose expectations are equal to the true gradients. In this paper, we explore the idea of following biased stochastic gradients in SVI. Our method replaces the natural gradient with a similarly constructed vector that uses a fixed-window moving average of some of its previous terms. We will demonstrate the many advantages of this technique. First, its computational cost is the same as for SVI and storage requirements only multiply by a constant factor. Second, it enjoys significant variance reduction over the unbiased estimates, smaller bias than averaged gradients, and leads to smaller mean-squared error against the full gradient. We test our method on latent Dirichlet allocation with three large corpora.

研究の動機と目的

  • SVIにおける確率的勾配の高分散が収束性とモデル品質に与える悪影響を是正すること。
  • 従来の不偏推定に依存する慣習をくつがえす、バイアス付きの確率的勾配の利用を検討すること。
  • 勾配の分散を低減しつつ、SVIの計算的特性と制約保持性を維持する手法を開発すること。
  • 滑らかな勾配推定器によるバイアスと分散のバランスを最適化することで、完全勾配に対する平均二乗誤差を低減すること。
  • 実世界のコーパスを用いた大規模トピックモデリングタスクにおいて、性能向上を実証すること。

提案手法

  • 標準的な不偏な確率的自然勾配を、過去の十分統計量の固定ウィンドウ型移動平均を用いた滑らかな勾配に置き換える。
  • 滑らかな勾配は、直近L個の十分統計量の重み付き平均として計算される:$\sum_{j=0}^{L-1} \hat{S}_{i-j} $、勾配更新における現在の $\hat{S}_i$ を置き換える。
  • 更新則は変換されない凸結合の形を保ち続ける:$\lambda_{i+1} = (1 - \rho_i)\lambda_i + \rho_i(\eta + N \cdot \text{smoothed } \hat{S}_i)$、パラメータの妥当性が維持される。
  • 計算コストは標準的なSVIと同一であり、ストレージはウィンドウサイズLに比例して定数倍に増加する。
  • 本手法は、パラメータ自体を平均化しないため、平均化勾配(AG)で見られる制約違反を回避する。
  • 導入されるバイアスはAGより小さく、同じ分散低減効果を達成しているため、平均二乗誤差が低くなる。

実験結果

リサーチクエスチョン

  • RQ1バイアス付きの確率的勾配は、収束速度とモデル品質という観点から、確率的変分ベイズ推論の性能を向上させ得るか?
  • RQ2過去の十分統計量の固定ウィンドウ型移動平均を用いることで、不偏推定に比べて勾配分散をより効果的に低減できるか? また、計算効率は維持できるか?
  • RQ3滑らかな勾配におけるバイアスと分散のトレードオフは、大規模データにおける最終的なモデル尤度にどのように影響を与えるか?
  • RQ4平均化勾配(AG)のような既存のバイアス付き勾配手法に比べ、本手法はパラメータの妥当性(例:正性または単体制約)をよりよく保てるか?
  • RQ5予測性能と計算コストの観点から、滑らかな勾配における最適なウィンドウサイズLは何か?

主な発見

  • 滑らかな勾配手法は、ストレージ要件の定数倍増加に留め、標準的なSVIの不偏勾配に比べて顕著に分散が低減された。
  • 3つの大規模コーパス(Arxiv, NYT, Wikipedia)における潜在ディリクレ割り当て(LDA)において、中程度のウィンドウサイズ(L=10~L=100)が、ホールドアウト予測尤度を最も高めた。
  • 本手法は標準的なSVIよりも収束が早く、より良い局所最適解に到達した。特にL=10–100の範囲で最高の性能を示したが、L=∞(完全平均化)では過剰なバイアスが問題となった。
  • 平均化勾配(AG)に比べ、本手法はバイアスと分散の両面で優れており、AGはより大きなバイアスを生じさせ、パラメータ制約を破った。
  • 一定の学習率10⁻³と24時間の時間制約のもと、本手法はArxivコーパスを最大30回分の有効なパスを回り、NYTでは5回、Wikipediaでは6回を達成し、ベースラインのSVIよりも高い尤度を得た。
  • 本手法の性能は、異なるコーパス間で一貫しており、3つのデータセットすべてで予測確率が一貫して向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。