Skip to main content
QUICK REVIEW

[論文レビュー] Two Methods For Wild Variational Inference

Qiang Liu, Yihao Feng|arXiv (Cornell University)|Nov 30, 2016
Gaussian Processes and Bayesian Inference参考文献 25被引用数 9
ひとこと要約

本稿では、推論ネットワークにおける滑らかな密度関数の必要性を回避する2つのワイルド変分推論手法を提案する。これにより、一般の確率的ニューラルサンプラーのエンドツーエンド学習が可能になる。スティーブ分散とアンモタイズドSVGDを活用することで、確率的勾配ランジュヴィンダイナミクス(SGLD)の最適ステップサイズを自動的に学習し、ガウス混合モデルおよびベイズロジスティック回帰の両タスクで、手動で設計されたスケジュールを著しく上回る性能を発揮する。

ABSTRACT

Variational inference provides a powerful tool for approximate probabilistic in- ference on complex, structured models. Typical variational inference methods, however, require to use inference networks with computationally tractable proba- bility density functions. This largely limits the design and implementation of vari- ational inference methods. We consider wild variational inference methods that do not require tractable density functions on the inference networks, and hence can be applied in more challenging cases. As an example of application, we treat stochastic gradient Langevin dynamics (SGLD) as an inference network, and use our methods to automatically adjust the step sizes of SGLD, yielding significant improvement over the hand-designed step size schemes

研究の動機と目的

  • 推論ネットワークに滑らかな密度関数が必須であるという変分推論の制限を解消し、モデルの柔軟性を高めること。
  • 滑らかでない密度関数を有する一般の推論ネットワークの訓練を可能とし、サンプリング手順の自動学習を可能とすること。
  • 手動でのチューニングなしに、確率的勾配ランジュヴィンダイナミクス(SGLD)の最適ステップサイズスケジュールを適応的に学習する手法を開発すること。
  • ワイルド変分推論が、複雑なベイズモデルにおいて、手動で設計された学習率スケジュールを上回ることを実証すること。

提案手法

  • 提案分布の密度評価を必要とせず、推論ネットワーク出力とターゲット分布との間の発散測度を最小化するために、カーネル化されたスティーブ分散(KSD)を用いる。
  • KL発散を低減する方向に沿って、反復的に推論ネットワークのパラメータを調整するために、アンモタイズドスティーブ変分勾配降下法(amortized SVGD)を採用する。
  • ミニバッチ設定でのKSD推定にU統計量を適用し、大規模データセットにおけるスケーラブルな最適化を可能にする。
  • SGLD更新を、学習可能なステップサイズを持つ微分可能ニューラルネットワークとして扱い、時間に沿ったバックプロパゲーションにより訓練する。
  • SGLDをT層からなる深層生成モデルとして捉え、各層が1回のSGLDステップに対応する構造を活用する。
  • ネットワークの隠れ状態を関数として用いたパラメトリックなステップサイズスケジュールを導入し、勾配ベース最適化により訓練する。

実験結果

リサーチクエスチョン

  • RQ1滑らかでない密度関数を有する推論ネットワークに変分推論を拡張可能か。これにより、より柔軟かつ適応的なサンプリングが可能になるか。
  • RQ2カーネル化されたスティーブ分散を用いることで、提案分布の明示的密度評価を必要とせず、ニューラルサンプラーを訓練可能か。
  • RQ3アンモタイズドSVGDは、複雑な後方分布におけるSGLDの最適ステップサイズスケジュールを効果的に学習可能か。
  • RQ4SGLDのステップサイズをエンドツーエンドで学習する手法と、手動で設計されたスケジュールとを比較した場合、収束性および精度の面でどのように異なるか。
  • RQ5学習されたステップサイズポリシーは、未観測のデータセットに一般化可能か。少ないイテレーションで高い性能を維持できるか。

主な発見

  • 1次元のガウス混合モデルにおいて、アンモタイズドSVGDとKSD最小化は、定数およびべき乗減衰スケジュールを著しく上回り、わずか20回のSGLDステップで顕著に優れた後方分布カバレッジを達成した。
  • Covertypeデータセットでは、両手法ともすべての手動設計学習率スケジュールを上回る高いテスト精度と尤度を得た。収束したSGLDおよびSVGDに近い性能を、少ないイテレーションで達成した。
  • KSDベースの訓練は初期段階で急速な性能向上を示し、その後飽和する傾向を示した。一方、アンモタイズドSVGDは初期段階の進捗が遅かったが、後期に顕著な性能向上を示した。
  • 学習されたステップサイズポリシーは、未観測のテストミニデータセットに対しても良好に一般化され、データパーティション間で強固で転送可能であることが示された。
  • T=100層の設定では、両手法とも精度および尤度の面でほぼ最適な性能を達成した。これは、SGLD更新の時間的ダイナミクスが効果的に学習されたことを示している。
  • 結果から、ワイルド変分推論が、複雑なベイズモデルにおける効率的なサンプリング手順の自動的・適応的かつスケーラブルな学習を可能にすることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。