Skip to main content
QUICK REVIEW

[論文レビュー] A Bayesian Perspective on Training Speed and Model Selection

Clare Lyle, Lisa Schut|arXiv (Cornell University)|Oct 27, 2020
Gaussian Processes and Bayesian Inference参考文献 43被引用数 9
ひとこと要約

本稿では、線形モデルおよび深層ニューラルネットワークにおける学習速度とマージナル尤度推定の間のベイジアンフレームワークを提案する。逐次処理されるデータにおける学習尤度の和(SOTL)がマージナル尤度を近似することを示唆することで、モデル選択および線形モデルの結合においても、速く学習するモデルが好まれることを明らかにした。これは、勾配上昇法(SGD)が深層学習において一般化性能が良いモデルに偏る理由を新たな観点から説明するものである。

ABSTRACT

We take a Bayesian perspective to illustrate a connection between training speed and the marginal likelihood in linear models. This provides two major insights: first, that a measure of a model's training speed can be used to estimate its marginal likelihood. Second, that this measure, under certain conditions, predicts the relative weighting of models in linear model combinations trained to minimize a regression loss. We verify our results in model selection tasks for linear models and for the infinite-width limit of deep neural networks. We further provide encouraging empirical evidence that the intuition developed in these settings also holds for deep neural networks trained with stochastic gradient descent. Our results suggest a promising new direction towards explaining why neural networks trained with stochastic gradient descent are biased towards functions that generalize well.

研究の動機と目的

  • 学習速度とベイジアンモデル選択におけるマージナル尤度の理論的関係を確立すること。
  • 標準的なSGDトレーニング手順を模倣する計算的に効率的なマージナル尤度推定器を開発すること。
  • 逐次的に処理されるデータにおける予測尤度の和(SOTL)として測定される学習速度が、モデル性能や線形結合における重み付けを予測できるかどうかを調査すること。
  • 線形モデルから得られた知見を、深層ニューラルネットワークの無限幅極限に拡張し、実証的に検証すること。
  • 同じ原則が、トレーニング済みDNN内のサブネットワークにも適用可能かどうかを検討し、ネットワーク内での一般化偏向のメカニズムを示唆すること。

提案手法

  • 逐次ベイジアン更新における以前のデータポイントを条件とした予測尤度の和に基づく、マージナル尤度の推定器の族を提案する。
  • 勾配降下法が線形モデルおよび無限幅DNNで正確な事後分布サンプルを生成することを活用し、SOTLとマージナル尤度推定との正確な対応関係を確立する。
  • 逐次的にデータポイントを処理しながら尤度の対数和を計算する反復的ベイジアン更新を用い、SOTL推定器を構築する。
  • SOTL推定器を線形モデルおよび無限幅DNNにおけるモデル選択タスクに適用し、正確なマージナル尤度と比較する。
  • SGDでトレーニングされた線形アンサンブルにおけるSOTLをテスト精度およびモデル重みの代理指標として、実証的に評価する。
  • 最終層の活性化を個々のモデルとみなすことで、DNN内のサブネットワークへの分析を拡張し、最終線形層におけるそれらの最終的重みを評価する。

実験結果

リサーチクエスチョン

  • RQ1逐次的に処理されるデータにおける予測尤度の和(SOTL)として測定される学習速度は、ベイジアンモデル選択におけるマージナル尤度の代理として機能できるか?
  • RQ2SOTL推定器は、回帰損失を最小化するようにトレーニングされた線形モデル結合におけるモデルの相対的重み付けを予測できるか?
  • RQ3SOTLは、確率的勾配上昇法(SGD)でトレーフィングされた深層ニューラルネットワークにおける一般化性能とどの程度相関しているか?
  • RQ4トレーニング済みDNN内に、線形モデルで観察された速く学習するモデルへの偏向と同様のメカニズム(例えば、サブネットワークの差別の重み付け)が存在するか?
  • RQ5SOTLは、有限幅のネットワークにおいても、SGDが一般化性能が良いモデルを好む理由を原理的かつ一貫した根拠で説明できるか?

主な発見

  • 線形モデルおよび無限幅DNNにおいて、逐次的に処理されたデータにおける学習尤度の和(SOTL)は、マージナル尤度をよく近似する。
  • SOTLはテストセット性能と強く相関している:平均テスト交差エントロピーが低いモデルほどSOTL値が高くなる。
  • 勾配降下法でトレーニングされた線形モデル結合において、SOTL値が高いモデルは顕著に大きな最終重みが割り当てられる。
  • 実証的結果から、SGDでトレーニングされたDNNにおいてもSOTLは最終テスト精度を予測でき、複数のアーキテクチャで強い正の相関が観察された。
  • DNN内では、個別に優れた性能を示すサブネットワーク(最終層直前の特徴量)は、最終線形層でより大きな重みが割り当てられ、速く学習するコンponentsへのバイアスが示された。
  • SOTL推定器は、高コストな変分推論の計算的効率の良い代替手段を提供し、正確な計算が可能な設定ではマージナル尤度とよく一致する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。