Skip to main content
QUICK REVIEW

[論文レビュー] Consistent Sparse Deep Learning: Theory and Computation

Yan Sun, Qifan Song|arXiv (Cornell University)|Feb 25, 2021
Gaussian Processes and Bayesian Inference参考文献 85被引用数 6
ひとこと要約

本論文は、ベイジアン枠組みにおいて、後方確率の整合性、変数選択の整合性、最適な一般化境界を保証する頻度主義に類似した手法を、スパースな深層ニューラルネットワーク(DNN)の学習に提案する。これは混合ガウス事前分布とラプラシアン近似に基づく周辺後方包含確率を用いることで達成され、確率的勾配降下法による効率的かつスケーラブルな学習を可能にするとともに、DNNの接続数が最大 $O(n/\log n)$ である場合の理論的保証を維持する。

ABSTRACT

Deep learning has been the engine powering many successes of data science. However, the deep neural network (DNN), as the basic model of deep learning, is often excessively over-parameterized, causing many difficulties in training, prediction and interpretation. We propose a frequentist-like method for learning sparse DNNs and justify its consistency under the Bayesian framework: the proposed method could learn a sparse DNN with at most $O(n/\log(n))$ connections and nice theoretical guarantees such as posterior consistency, variable selection consistency and asymptotically optimal generalization bounds. In particular, we establish posterior consistency for the sparse DNN with a mixture Gaussian prior, show that the structure of the sparse DNN can be consistently determined using a Laplace approximation-based marginal posterior inclusion probability approach, and use Bayesian evidence to elicit sparse DNNs learned by an optimization method such as stochastic gradient descent in multiple runs with different initializations. The proposed method is computationally more efficient than standard Bayesian methods for large-scale sparse DNNs. The numerical results indicate that the proposed method can perform very well for large-scale network compression and high-dimensional nonlinear variable selection, both advancing interpretable machine learning.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)の過剰パラメータ化が、学習、一般化、解釈可能性を妨げる問題に対処すること。
  • ベイジアン枠組みにおいて理論的整合性保証を備えたスパースDNNの学習手法を開発すること。
  • 確率的勾配降下法などの最適化ベース手法を用いて、大規模スパースDNNの効率的かつスケーラブルな学習を可能にすること。
  • 有界な重みと接続数を持つスパースDNNに対して、後方確率の整合性と変数選択の整合性を確立すること。
  • ややきつい正則性条件のもとで、スパースDNNの漸近的最適一般化境界を確立すること。

提案手法

  • DNN重みに混合ガウス事前分布を適用し、スパarsityを誘導するとともにベイジアン推論を可能にする。
  • 構造選択のための周辺後方包含確率を計算するためにラプラシアン近似を適用する。
  • 複数回のSGDトレーニング(異なる初期化を用いて)の結果から、ベイジアンエビデンスを用いてスパースDNNを選択する。
  • 混合ガウス事前分布のもとでスパースDNNの後方確率の整合性を確立し、標本サイズが増加するにつれて真のモデルに収束することを保証する。
  • MCMCよりも計算効率の高い最適化ベースのトレーニング(例:SGD)とベイジアンモデル選択を組み合わせる。
  • 層ごとの活性化関数と重み摂動に関する再帰的不等式を用いて、ネットワーク出力とモデル差の理論的境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1接続数が $O(n/\log n)$ のスパースDNNは、後方確率の整合性と最適一般化境界を達成できるか?
  • RQ2ベイジアン後方包含確率を用いて、スパースDNNの構造は一貫して回復可能か?
  • RQ3確率的勾配降下法などの最適化ベース手法とベイジアンモデル選択を組み合わせることで、一貫したスパースDNN学習が可能か?
  • RQ4提案手法は、高次元非線形特徴選択において、変数選択の整合性をどのように保証するか?
  • RQ5ベイジアン枠組みのもとで、確率的勾配降下法でトレーニングされたスパースDNNに対して、どのような理論的保証を確立できるか?

主な発見

  • 提案手法は、混合ガウス事前分布のもとでスパースDNNの後方確率の整合性を達成し、標本サイズが増加するにつれて真のモデルに収束することを保証する。
  • ラプラシアン近似に基づく周辺後方包含確率を用いて変数選択の整合性が確立され、関連する接続の信頼性のある同定が可能になる。
  • 漸近的に最適な一般化境界が保証され、スパースDNNの理論的限界と一致する。
  • 理論的分析により、接続数が最大 $O(n/\log n)$ のスパースDNNが、所望の精度で真の写像を近似可能であることが示された。
  • SGDとベイジアンエビデンスを組み合わせることで、大規模スパースDNNの効率的学習が可能となり、MCMCの計算負荷を回避できる。
  • 数値実験の結果、ネットワーク圧縮および高次元非線形変数選択において優れた性能を示し、解釈可能な機械学習の前進が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。