Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Variational Inference for Sparse Deep Learning with Theoretical Guarantee

Jincheng Bai, Qifan Song|arXiv (Cornell University)|Nov 15, 2020
Stochastic Gradient Optimization Techniques被引用数 7
ひとこと要約

本稿では、ベルヌーイ分布の連続的リラクゼーションを用いたスパイクアンドスラブ事前分布を用いて、計算的に効率的な変分ベイズ手法を、スパースな深層ニューラルネットワークに提案する。理論的な事後分布の一致性と最適収束率を確立し、多層ネットワークおよび実世界のデータセットにおいて、不確実性の定量化と一貫性のある変数選択を示している。

ABSTRACT

Sparse deep learning aims to address the challenge of huge storage consumption by deep neural networks, and to recover the sparse structure of target functions. Although tremendous empirical successes have been achieved, most sparse deep learning algorithms are lacking of theoretical support. On the other hand, another line of works have proposed theoretical frameworks that are computationally infeasible. In this paper, we train sparse deep neural networks with a fully Bayesian treatment under spike-and-slab priors, and develop a set of computationally efficient variational inferences via continuous relaxation of Bernoulli distribution. The variational posterior contraction rate is provided, which justifies the consistency of the proposed variational Bayes method. Notably, our empirical results demonstrate that this variational procedure provides uncertainty quantification in terms of Bayesian predictive distribution and is also capable to accomplish consistent variable selection by training a sparse multi-layer neural network.

研究の動機と目的

  • 既存のスパースな深層学習手法、特に変分推論フレームワークにおいて理論的支援が不足している問題に対処すること。
  • スパarsityを維持しつつ理論的一致性を保証する計算的に効率的なベイズ推論手法を開発すること。
  • スパースな深層ニューラルネットワークにおけるベイズ予測分布を通じた不確実性の定量化を可能にすること。
  • スパイクアンドスラブ事前分布と適切なハイパーパrameterキャリブレーションを活用して、多層ネットワークにおける一貫性のある変数選択を達成すること。
  • 計算効率と統計的一致性を統合することで、理論的スパースな深層学習と実用的でスケーラブルな推論のギャップを埋めること。

提案手法

  • すべての重みとバイアスにスパイクアンドスラブ事前分布を適用し、スパイク成分が重みをゼロに強制し、スラブ成分が非ゼロ値を許容する。
  • 変分推論における微分可能な最適化を可能にするために、ベルヌーイ分布の連続的リラクゼーションを用いる。離散的サンプリングを回避する。
  • 真の事後分布をスパースなネットワーク構造の近似に変換するため、変分推論を適用し、ベイズ推論を最適化問題に変換する。
  • 適切なハイパーパrameter設定下での方法の一貫性を理論的に正当化するため、変分事後分布の収縮率を導出する。
  • 再パラメータライゼーショントリックと確率的勾配降下法(例:Adam)を用いて、変分目的関数を計算的に効率的に最適化する。
  • エッジ活性化の事前確率をキャリブレーションして、推定誤差、変分誤差、近似誤差のバランスをとることで、最適収束率を達成する。

実験結果

リサーチクエスチョン

  • RQ1完全なベイズ的アプローチにより、スパースな深層学習が計算効率と理論的一致性の両方を達成できるか?
  • RQ2変分推論におけるベルヌーイ分布の連続的リラクゼーションが、真の事後分布のスパース構造を保持するか?
  • RQ3提案手法は、複数の隠れ層を持つ深層ネットワークにおいて一貫性のある変数選択を達成できるか?
  • RQ4異なるハイパーパラメータ設定下での変分事後分布の収縮率はどのように振る舞い、最適収束率に達するか?
  • RQ5本手法は、分布外の入力に対して、ベイズ予測分布を通じて信頼性のある不確実性の定量化を提供できるか?

主な発見

  • 提案手法は、すべてのUCI回帰データセットで最良のテストRMSEを達成した。特に、Kin8nm(0.08 ± 0.00)、Naval(0.00 ± 0.00)、Power Plant(4.01 ± 0.18)で、高いスパarsity(例:Navalでは82.9%)を維持した。
  • MNISTデータセットでは、本手法が優れた不確実性の定量化を示した。曖昧な重ね合わせ画像に対して、頻度主義ベースラインの決定的予測とは異なり、不確信を反映した確率的出力を生成した。
  • Fashion-MNISTデータセットでは、80エポック以降において、完全ベイズベースライン(VBNN)よりも高いテスト精度を維持した。一方、完全BNNは過学習を示した。
  • 本手法は多層ネットワークにおいて一貫したサポート回復を達成し、変数選択タスクにおいて単層手法を上回った。
  • 事後スパarsityは良好に制御されており、解釈可能であった。Kin8nmでは64.5%、Navalでは82.9%、Year(90特徴量)では20.8%を報告し、効果的な構造回復を示した。
  • 理論的分析により、適切なハイパーパラメータチューニング下で、変分事後分布の収縮率が推定誤差、変分誤差、近似誤差の最適なバランスを達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。