Skip to main content
QUICK REVIEW

[論文レビュー] Gaussian Process Neurons Learn Stochastic Activation Functions

Sebastian Urban, Marcus Basalla|arXiv (Cornell University)|Nov 29, 2017
Gaussian Processes and Bayesian Inference参考文献 26被引用数 4
ひとこと要約

本稿では、ガウス過程事前分布を用いて確率的で非パラメトリックな活性化関数を学習する確率的ニューラルユニット、ガウス過程ニューロン(GPN)を提案する。これにより、不確実性を考慮した予測と内在的な正則化が可能になる。変分ベイズ推論と中心極限定理を用いることで、完全に決定論的な損失関数が導出され、確率的勾配降下法による効率的な学習が可能になりつつ、標準的なニューラルネットワークの関数的構造を維持することができる。

ABSTRACT

We propose stochastic, non-parametric activation functions that are fully learnable and individual to each neuron. Complexity and the risk of overfitting are controlled by placing a Gaussian process prior over these functions. The result is the Gaussian process neuron, a probabilistic unit that can be used as the basic building block for probabilistic graphical models that resemble the structure of neural networks. The proposed model can intrinsically handle uncertainties in its inputs and self-estimate the confidence of its predictions. Using variational Bayesian inference and the central limit theorem, a fully deterministic loss function is derived, allowing it to be trained as efficiently as a conventional neural network using mini-batch gradient descent. The posterior distribution of activation functions is inferred from the training data alongside the weights of the network. The proposed model favorably compares to deep Gaussian processes, both in model complexity and efficiency of inference. It can be directly applied to recurrent or convolutional network structures, allowing its use in audio and image processing tasks. As an preliminary empirical evaluation we present experiments on regression and classification tasks, in which our model achieves performance comparable to or better than a Dropout regularized neural network with a fixed activation function. Experiments are ongoing and results will be added as they become available.

研究の動機と目的

  • データから活性化関数を学習するニューラルネットワークユニットの開発。固定された手動設計の関数に依存するのではなく、学習によって関数を決定する。
  • 活性化関数を確率的にモデル化することで、ニューラルネットワークの予測における不確実性の定量化を統合する。
  • 活性化関数にベイズ的非パラメトリック事前分布を用いることで、モデルの複雑さを制御し、過学習を防ぐ。
  • 標準的なディープラーニング最適化手法を用いて、このようなモデルの効率的な学習を可能にする。
  • 従来のニューラルネットワークと同等に効率的かつ容易に統合可能な確率的ディープラーニングモデルの構築。

提案手法

  • 各ニューロンの活性化関数に、平方指数共分散関数を用いたガウス過程事前分布を設定し、非パラメトリックかつ滑らかな関数とする。
  • 変分ベイズ推論を用いて活性化関数の事後分布を近似し、エンドツーエンドの学習を可能にする。
  • 中心極限定理を活用して、隠れ層の活性化が近似的に正規分布に従うことを示し、変分目的関数の決定論的近似を可能にする。
  • ガウス過程事前分布を周辺化し、モンテカルロサンプリングによる事後分布の近似を用いることで、完全に決定論的な損失関数を導出し、標準的な誤差逆伝播法を可能にする。
  • 計算コストを削減するためのパラメトリックなGPNバージョンを導入し、ミニバッチ勾配降下法による効率的な学習を実現する。
  • 高速ドロップアウトとスパース変分ガウス過程回帰のアイデアを統合し、非パラメトリックGPNの効率的かつスケーラブルな学習を達成する。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックで確率的な事前分布を用いて、データから直接活性化関数を学習できるニューラルネットワークユニットは構築可能か?
  • RQ2このようなモデルは入力の不確実性を扱い、予測の信頼性を内蔵的に推定できるか?
  • RQ3非パラメトリックなGPベースの活性化関数は、勾配のモンテカルロサンプリングなしに確率的勾配降下法で効率的に学習可能か?
  • RQ4GPNの性能は、ReLU や Leaky ReLU などの固定活性化関数を用いた標準的なディープネットワークと比べてどうか?
  • RQ5GPNは、CNN や RNN といった複雑なアーキテクチャに効果的に統合可能か?

主な発見

  • 提案されたGPNモデルは、小規模な回帰および分類データセットにおいて、固定活性化関数を用いたドロップアウト正則化付きニューラルネットワークと同等またはそれ以上の性能を達成した。
  • 最尤推定で学習されたパラメトリックGPNバージョンは、固定活性化関数を用いた標準ネットワークと比較して、一般化性能において一貫した向上を示した。
  • 中心極限定理の近似により、完全に決定論的な損失関数が導出され、標準的な誤差逆伝播法と同等の効率で学習が可能になった。
  • モデルは畳み込み型および再帰型アーキテクチャに直接適用可能であり、画像処理や音声処理タスクへの応用が可能である。
  • GPNは、深層ガウス過程と比較して、はるかに少ない変分パラメータを必要とし、学習がはるかに効率的である一方で、同様のインダクティブバイアスを維持している。
  • 予備的な結果では、GPNがより強い非線形性を有するため、一般化性能において標準ネットワークを上回る可能性があると示唆されており、大規模データセットを用いたさらなる実験が進行中である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。