Skip to main content
QUICK REVIEW

[論文レビュー] A Gaussian Process perspective on Convolutional Neural Networks

Anastasia Borovykh|arXiv (Cornell University)|Oct 25, 2018
Gaussian Processes and Bayesian Inference参考文献 24被引用数 16
ひとこと要約

この論文は、畳み込み層における非i.i.d.入力へと中心極限定理を拡張することで、畳み込みニューラルネットワーク(CNN)に対するガウス過程(GP)の視点を確立している。CNNの出力が、従属的で同一分布でない入力に対しても、GP事前分布に収束することを示しており、実験的結果は、特にtanhなどの有界活性化関数を用いる場合、CNNがGPに類似した振る舞いを示すことを確認している。これにより、GP推論を用いた解析的不確実性評価が可能になる。

ABSTRACT

In this paper we cast the well-known convolutional neural network in a Gaussian process perspective. In this way we hope to gain additional insights into the performance of convolutional networks, in particular understand under what circumstances they tend to perform well and what assumptions are implicitly made in the network. While for fully-connected networks the properties of convergence to Gaussian processes have been studied extensively, little is known about situations in which the output from a convolutional network approaches a multivariate normal distribution.

研究の動機と目的

  • CNNの理論的理解を拡張し、ガウス過程(GPs)の観点からフレームワークを提示すること、特にGP事前分布への収束の文脈で。
  • 完全結合層とは異なり、CNNにおけるGP収束に関する理論的分析が不足しているという問題を解決すること。
  • 入力が従属的または同一分布でない場合に、CNNの出力が多変量正規分布に近づく条件を特定すること。
  • 活性化関数やネットワークの深さが収束に与える影響を評価し、CNNとGP事前分布の乖離を数値的に評価すること。
  • GPに類似した振る舞いが、CNNの事後分布における不確実性推定に与える影響を検討し、MCMCやアンサンブルを用いずに解析的推論を可能にすること。

提案手法

  • 畳み込み層における非i.i.d.重み付き和を扱うために、一般化された中心極限定理(Lyapunov型の境界)を適用し、i.i.d.入力に限らないGP収束フレームワークを拡張する。
  • CNN出力の再帰的カーネル表現を導出することで、GP共分散関数の構造を模倣し、GP事前分布との直接的な比較を可能にする。
  • 最大平均差分(MMD)を用いて、異なる活性化関数や入力タイプにおけるCNN出力分布と対応するGP事前分布との距離を数値的に測定する。
  • i.i.d.入力と自己回帰的時系列入力の両方を用いて、現実的な入力依存性のもとでのGP近似のロバストネスを評価する。
  • データセット上で訓練した後、CNNの事後平均と分散を、対応するGPのそれと比較する。アンサンブル推論(N=100)を用いて事後不確実性を近似する。
  • 線形、ReLU、双曲正接活性化関数を用いて、それらがGP収束および事後一致に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1入力がi.i.d.でない場合、畳み込みニューラルネットワークの出力がどの条件下でガウス過程事前分布に収束するのか?
  • RQ2活性化関数の選択(例:ReLU対tanh)が、CNN出力とGP事前分布との乖離にどのように影響するか?
  • RQ3入力依存性(例:自己回帰構造)がCNNのGP近似にどの程度影響を与えるか?
  • RQ4CNNのGP事前分布を用いて解析的に不確実性を推定できるか?また、CNNの事後分布はGPの事後分布とどの程度一致するか?
  • RQ5CNN出力がGPに収束する速度はどの程度か?また、深い層における従属変数に対し、これを厳密に証明できるか?

主な発見

  • 非i.i.d.入力に対しても、CNN出力分布がガウス過程事前分布に近づくことが、第1層におけるLyapunov型境界を用いて実証され、i.i.i.d.設定に限らないGP収束が拡張された。
  • ReLU活性化関数を用いる場合、特にi.i.i.d.入力では、ネットワークの深さが増すにつれてCNNとGP事前分布との乖離が顕著に増加し、GP行動からの逸脱が示された。
  • 有界活性化関数(例:双曲正接)を用いる場合、複数の層にわたり乖離が小さく保たれるため、非線形的かつ有界な変換のもとで強いGPに類似した振る舞いを示す。
  • 入力がAR(2)過程に従う場合、非有界活性化関数(線形およびReLU)ではCNN-GP乖離が有界活性化関数(tanh)よりも顕著に高くなる。これは、重み付き和における依存性の増加に起因する。
  • 100個のランダム初期化を用いたアンサンブル推論により、訓練済みCNNの事後平均と分散が、対応するGP事後分布と強く一致しており、GPに基づく不確実性評価がCNNに適用可能であることを示している。
  • 実験的結果から、有界活性化関数を用い、フィルターサイズが中程度(2–8)かつ深さが中程度(2–5層)のCNNはGPに類似した振る舞いを示すことが示唆され、CNNにおける解析的不確実性評価にGPを活用することが有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。