Skip to main content
QUICK REVIEW

[論文レビュー] Approximate Inference Turns Deep Networks into Gaussian Processes

Mohammad Emtiyaz Khan, Alexander Immer|arXiv (Cornell University)|Jun 5, 2019
Gaussian Processes and Bayesian Inference参考文献 22被引用数 13
ひとこと要約

本論文は、ベイジアン深層ニューラルネットワーク(DNN)におけるガウスノイズ近似とガウス過程(GP)の事後分布の理論的同等性を確立し、標準的なDNN学習中にGPカーネルと非線形特徴マップを抽出可能にする。驚くべきことに、導出されたカーネルはニューラルタングェントカーネル(NTK)に等しく、交差検証を回避してGPの周辺尤度を用いたDNNハイパーパrameterチューニングが可能になる。

ABSTRACT

Deep neural networks (DNN) and Gaussian processes (GP) are two powerful models with several theoretical connections relating them, but the relationship between their training methods is not well understood. In this paper, we show that certain Gaussian posterior approximations for Bayesian DNNs are equivalent to GP posteriors. This enables us to relate solutions and iterations of a deep-learning algorithm to GP inference. As a result, we can obtain a GP kernel and a nonlinear feature map while training a DNN. Surprisingly, the resulting kernel is the neural tangent kernel. We show kernels obtained on real datasets and demonstrate the use of the GP marginal likelihood to tune hyperparameters of DNNs. Our work aims to facilitate further research on combining DNNs and GPs in practical settings.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)の学習手順とガウス過程(GP)の間の理論的接続を確立すること。
  • ラプラス近似や変分ベイズ推論を用いたベイジアンDNNにおけるガウス事後分布近似が、数学的にGP事後分布に等価であることを示すこと。
  • 標準的なDNN学習中にGPカーネルと非線形特徴マップを抽出可能にすること。
  • 導出されたカーネルがニューラルタングェントカーネル(NTK)に一致することを示し、NTKの出現に新たな視点を提供すること。
  • 交差検証を回避して、GP周辺尤度を用いたDNNハイパーパrameterチューニングを可能にすること。

提案手法

  • ベイジアンDNNにガウス事後分布近似(ラプラス近似および変分ベイズ推論)を適用し、同等のGP事後分布を導出する。
  • DNNの重み事後分布近似から対応するGPカーネルと非線形特徴マップを導出する。
  • 得られたカーネルが、DNN出力のヤコビ行列から導出されるニューラルタングェントカーネル(NTK)に等しいことを示す。
  • DNN2GPフレームワークを用いて、MNIST や CIFAR などの実データセット上で学習されたDNNから特徴マップとカーネルを抽出する。
  • DNN2GP変換から得られるGP周辺尤度を用いて、正則化強度、ノイズ分散、ネットワーク幅などのDNNハイパーパrameterをチューニングする。
  • 合成データおよび実データセット(例:UCI レッドワイン品質)を用いて手法を検証し、周辺尤度とテスト損失に基づくハイパーパrameter選択を比較する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンDNNにおけるガウス事後分布近似を、GP事後分布に正式に写像できるか?
  • RQ2近似推論を用いたDNN学習から導出されたカーネルは、ニューラルタングェントカーネル(NTK)に一致するか?
  • RQ3DNN学習から得られるGP周辺尤度を用いて、DNNハイパーパrameterを効果的にチューニングできるか?
  • RQ4DNNから抽出された特徴マップと対応するGPカーネルの関係は何か?
  • RQ5GP周辺尤度を用いて選択されたハイパーパrameterは、実世界のDNNにおける標準的なテスト誤差に基づく選択と比較してどうなるか?

主な発見

  • ラプラス近似や変分ベイズ推論を用いたベイジアンDNNにおけるガウス事後分布近似は、数学的にGP回帰モデルの事後分布に等しい。
  • DNN学習プロセスから導出されたカーネルは、ニューラルタングェントカーネル(NTK)に等しく、事後分布近似から自然に出現する。
  • DNN2GPフレームワークを用いて学習済みDNNから抽出した非線形特徴マップは意味のある表現を捉えており、MNIST や CIFAR データセットで効果的に可視化できる。
  • DNN2GP変換から得られるGP周辺尤度は、低テスト誤差を達成するDNNハイパーパラメータ(例:正則化、ネットワーク幅、ノイズ分散)を効果的に選択でき、交差検証と同等の性能を示す。
  • 合成データおよび実世界のデータセット(例:UCI レッドワイン品質)において、GP周辺尤度を用いて選択されたハイパーパラメータは良好な一般化性能を示し、ハイパーパラメータチューニングの目的関数としての有効性が裏付けられる。
  • このフレームワークにより、DNNとGPのシームレスな統合が可能となり、アーキテクチャの変更なしに標準的なDNNに対してGP推論ツールを活用できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。