Skip to main content
QUICK REVIEW

[論文レビュー] Expectation Propagation for Neural Networks with Sparsity-promoting Priors

Pasi Jylänki, Aapo Nummenmaa|arXiv (Cornell University)|Mar 27, 2013
Gaussian Processes and Bayesian Inference参考文献 46被引用数 20
ひとこと要約

本稿では、重みにスパースな階層的事前分布を導入することで、モデルパラメータ(重みスケールやノイズ分散を含む)に対する効率的な近似ベイズ推論を可能にする、期待値伝播(EP)フレームワークを提案する。この手法は、アンサンブルのスパース線形モデルと同等の計算効率を達成しながら、ラプラス分布や自動関連性決定(ARD)ガウス分布といった柔軟な事前分布をサポートし、MAPやMCMCベースラインと比較して優れた予測性能と過学習に対するロバスト性を示している。

ABSTRACT

We propose a novel approach for nonlinear regression using a two-layer neural network (NN) model structure with sparsity-favoring hierarchical priors on the network weights. We present an expectation propagation (EP) approach for approximate integration over the posterior distribution of the weights, the hierarchical scale parameters of the priors, and the residual scale. Using a factorized posterior approximation we derive a computationally efficient algorithm, whose complexity scales similarly to an ensemble of independent sparse linear models. The approach enables flexible definition of weight priors with different sparseness properties such as independent Laplace priors with a common scale parameter or Gaussian automatic relevance determination (ARD) priors with different relevance parameters for all inputs. The approach can be extended beyond standard activation functions and NN model structures to form flexible nonlinear predictors from multiple sparse linear models. The effects of the hierarchical priors and the predictive performance of the algorithm are assessed using both simulated and real-world data. Comparisons are made to two alternative models with ARD priors: a Gaussian process with a NN covariance function and marginal maximum a posteriori estimates of the relevance parameters, and a NN with Markov chain Monte Carlo integration over all the unknown model parameters.

研究の動機と目的

  • 高次元の入力特徴を持つニューラルネットワークにおける過学習を解消するため、階層的事前分布を用いて重みパラメータのスパース性を促進すること。
  • 事後分布が閉形式で得られない非線形モデルに対する計算効率の良いベイズ推論手法を開発し、ラプラス近似やMCMCの制限を回避すること。
  • ラプラス分布やARDガウス分布などの階層的事前分布を用いて、入力特徴の重要度を柔軟にモデリングし、自動関連性決定による特徴選択を可能にすること。
  • MCMCや点推定手法に対するスケーラブルで高精度な代替手法として、スパースニューラルネットワークにおけるハイパーパrameter学習を提供すること。
  • 期待値伝播を非線形モデルに拡張し、複雑な非共役の尤度関数と階層的事前分布を有するモデルに適用可能にする。

提案手法

  • 重み、階層的スケールパラメータ、残差分散の事後分布を近似するために期待値伝播(EP)を用い、因子化された事後分布近似を活用する。
  • ネットワーク重みにラプラス分布やガウス型ARDといった階層的事前分布を適用し、スパース性を促進するとともに、不要な入力特徴を自動で同定する。
  • サイト固有の傾斜付き分布とガウス近似を用いて、繰り返し事後分布サイトのパラメータを更新し、正規化項は数値積分とコレスキー分解によって計算する。
  • キャビティ分布の閉形式更新を導出し、正準パラメータ化を用いることで収束性を保証するとともに、勾配ベースのハイパーパrameter最適化を可能にする。
  • EP近似を用いて周辺尤度を近似することで、予測不確実性を統合し、勾配ベースのハイパーパrameterチューニングを可能にする。
  • 逐次的および並列的EP更新をサポートし、スパース線形モデルのアンサンブルを学習するのと同程度の計算複雑度を実現する。

実験結果

リサーチクエスチョン

  • RQ1期待値伝播は、スパース性を促進する事前分布を有するベイズニューラルネットワークに対して、MCMC やラプラス近似の代替として精度よくかつ効率的に機能するか?
  • RQ2ラプラス分布やARDガウス分布といった階層的事前分布を用いることで、非線形回帰タスクにおけるモデルのスパース性と予測性能にどのような影響を与えるか?
  • RQ3提案されたEPベースの手法は、MAPベースのARDやMCMCアプローチと比較して、予測精度と過学習に対するロバスト性において優れているか?
  • RQ4EPフレームワークは、一般の活性化関数や隠れユニット間の相互作用項を有する非線形モデルに、どの程度まで拡張可能か?
  • RQ5事後分布が解析的に得られない状況下でも、EPから得られる周辺尤度近似は、ハイパーパラメータ最適化に有効に利用できるか?

主な発見

  • EPベースの手法は、MCMCと同等の予測性能を達成し、特に不要な特徴を含む高次元設定下でMAPベースのARD手法を上回る。
  • EPと階層的事前分布の組み合わせにより、過学習を防ぎつつ、観測数より特徴数が多い状況でも、不要な入力を効果的に抑制する強固な特徴選択が可能になる。
  • アルゴリズムの計算複雑度は、独立したスパース線形モデルのアンサンブルを学習するのと同程度にスケーリングされ、大規模問題に対しても実用的である。
  • EPは、ラプラス近似よりも優れた事後分布近似を提供し、特に非微分可能な事前分布(例:ラプラス分布)に起因する事後分布の曲率が不適切に定義される場合に顕著に優位性を示す。
  • EPから得られる周辺尤度近似により、ノイズ分散や入力重みスケールといったハイパーパラメータの勾配ベース最適化が効果的に可能となり、モデルのキャリブレーションが向上する。
  • シミュレートデータおよび実世界のデータに対する実験結果から、本手法は高い予測精度を維持するとともに、関連性パラメータの事後分布を通じて明確に関連する特徴を同定できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。