Skip to main content
QUICK REVIEW

[論文レビュー] Is SGD a Bayesian sampler? Well, almost

Chris Mingard, Guillermo Valle-Pérez|arXiv (Cornell University)|Jun 26, 2020
Stochastic Gradient Optimization Techniques参考文献 94被引用数 8
ひとこと要約

この論文は、過パラメータ化された深層ニューラルネットワークにおける確率的勾配降下法(SGD)がベイジアンサンプラーとして機能するかどうかを調査する。ガウス過程を用いてベイジアン事後分布を推定し、訓練データ $S$ に対して関数 $f$ に収束する確率 $P_{\textrm{SGD}}(f|S)$ が、ベイジアン事後分布 $P_{\textrm{B}}(f|S)$ と強く相関していることが判明した。これは、一般化の主なインダクティブバイアスが、SGDそのものではなく、未学習ネットワークのパラメータ-関数写像に起因していることを示している。

ABSTRACT

Overparameterised deep neural networks (DNNs) are highly expressive and so can, in principle, generate almost any function that fits a training dataset with zero error. The vast majority of these functions will perform poorly on unseen data, and yet in practice DNNs often generalise remarkably well. This success suggests that a trained DNN must have a strong inductive bias towards functions with low generalisation error. Here we empirically investigate this inductive bias by calculating, for a range of architectures and datasets, the probability $P_{SGD}(f\mid S)$ that an overparameterised DNN, trained with stochastic gradient descent (SGD) or one of its variants, converges on a function $f$ consistent with a training set $S$. We also use Gaussian processes to estimate the Bayesian posterior probability $P_B(f\mid S)$ that the DNN expresses $f$ upon random sampling of its parameters, conditioned on $S$. Our main findings are that $P_{SGD}(f\mid S)$ correlates remarkably well with $P_B(f\mid S)$ and that $P_B(f\mid S)$ is strongly biased towards low-error and low complexity functions. These results imply that strong inductive bias in the parameter-function map (which determines $P_B(f\mid S)$), rather than a special property of SGD, is the primary explanation for why DNNs generalise so well in the overparameterised regime. While our results suggest that the Bayesian posterior $P_B(f\mid S)$ is the first order determinant of $P_{SGD}(f\mid S)$, there remain second order differences that are sensitive to hyperparameter tuning. A function probability picture, based on $P_{SGD}(f\mid S)$ and/or $P_B(f\mid S)$, can shed new light on the way that variations in architecture or hyperparameter settings such as batch size, learning rate, and optimiser choice, affect DNN performance.

研究の動機と目的

  • 過パラメータ化された深層ニューラルネットワーク(DNN)におけるSGDが、関数選択確率をベイジアン事後分布と比較することで、ベイジアンサンプラーとして機能するかどうかを調査すること。
  • DNNにおける一般化を可能にするインダクティブバイアスが、SGDの最適化ダイナミクスに起因するのか、それとも未学習ネットワークのパラメータ-関数写像に起因するのかを特定すること。
  • ハイパーパrameterチューニングと最適化手法の選択が、SGDの関数選択確率とベイジアン事後分布との間の2次偏差に与える影響の程度を定量化すること。
  • 関数選択確率 $P_{\textrm{SGD}}(f|S)$ と $P_{\textrm{B}}(f|S)$ に基づく関数確率フレームワークを構築し、アーキテクチャ的およびハイパーパrameter的選択がDNN一般化に与える影響を分析すること。
  • この関数確率の視点が、不確実性評価とモデル設計に与える影響、特にディープアンサンブルとの関連について評価すること。

提案手法

  • さまざまなDNNアーキテクチャとデータセットにおいて、訓練データ $S$ と整合する関数 $f$ にSGDが収束する確率 $P_{\textrm{SGD}}(f|S)$ を経験的に推定する。
  • ガウス過程を用いて、非パラメトリックにベイジアン事後分布 $P_{\textrm{B}}(f|S)$ を推定し、これは、ランダムに抽出された未学習DNNが、データ $S$ をもとに関数 $f$ を表現する確率を表す。
  • $P_{\textrm{SGD}}(f|S)$ と $P_{\textrm{B}}(f|S)$ を対数スケールで比較し、相関関係を評価し、乖離を特定する。
  • パラメータ-関数写像の役割を分析するため、未学習DNNにおける事前バイアスを評価し、特に低複雑性・低誤差関数への指数的バイアスを特定する。
  • 学習率、バッチサイズ、最適化手法の選択といったハイパーパrameterを体系的に変化させ、$P_{\textrm{SGD}}(f|S)$ と $P_{\textrm{B}}(f|S)$ 間の2次偏差に与える影響を測定する。
  • 関数確率の視点を用いて、さまざまなアーキテクチャおよび学習設定におけるモデル性能の解釈と比較を行う。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されたDNNにおいて、SGDの関数選択確率 $P_{\textrm{SGD}}(f|S)$ とベイジアン事後分布 $P_{\textrm{B}}(f|S)$ との相関度はどの程度か?
  • RQ2DNNにおける一般化のインダクティブバイアスは、主にSGDの最適化ダイナミクスに起因するのか、それとも未学習ネットワークの固有のパラメータ-関数写像に起因するのか?
  • RQ3学習率、バッチサイズ、最適化手法の種類といったハイパーパラメータの選択が、$P_{\textrm{SGD}}(f|S)$ と $P_{\textrm{B}}(f|S)$ 間の2次偏差に与える影響はいかほどか?
  • RQ4$P_{\textrm{SGD}}(f|S)$ と $P_{\textrm{B}}(f|S)$ を用いた関数確率フレームワークは、平均テスト誤差のみに依存する分析よりも、DNN一般化の理解をより洗練されたものにできるか?
  • RQ5SGDとベイジアンサンプリングの間の観察された一致は、DNNにおける予測不確実性評価にディープアンサンブルを用いることの正当性を裏付けるものか?

主な発見

  • SGDが訓練データ $S$ と整合する関数 $f$ に収束する確率 $P_{\textrm{SGD}}(f|S)$ が、ベイジアン事後分布 $P_{\textrm{B}}(f|S)$ と非常に強く相関しており、特に対数スケールで顕著である。
  • ベイジアン事後分布 $P_{\textrm{B}}(f|S)$ は、低一般化誤差および低複雑性の関数に強くバイアスがかかることが判明し、未学習DNNのパラメータ-関数写像がインダクティブバイアスの主な源であることを示している。
  • SGDの関数選択確率とベイジアン事後分布との間の2次偏差は、学習率やバッチサイズといったハイパーパラメータのチューニングに敏感であることが判明し、SGDが微妙な非ベイジアン効果を導入している可能性を示唆している。
  • 過パラメータ化されたDNNにおける一般化の主な要因は、SGD自体の特別な性質ではなく、パラメータ-関数写像のインダクティブバイアスにある。
  • ベイジアン事後分布 $P_{\textrm{B}}(f|S)$ と $P_{\textrm{SGD}}(f|S)$ に基づく関数確率の視点は、平均テスト誤差のみに依存する分析よりも、ハイパーパラメータおよびアーキテクチャ的選択の評価に、より洗練された分析ツールを提供する。
  • SGDとベイジアンサンプリングの間の類似性は、DNNにおける予測不確実性評価にディープアンサンブルを用いることの理論的根拠を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。