Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Deep Learning via Subnetwork Inference

Erik Daxberger, Eric Nalisnick|UvA-DARE (University of Amsterdam)|Oct 28, 2020
Gaussian Processes and Bayesian Inference参考文献 79被引用数 11
ひとこと要約

この論文は、スケーラブルなベイジアンディープラーニング手法として、サブネットワーク推論を提案する。この手法は、神経ネットワークの重みの小さな戦略的選択されたサブセットに対してのみ、完全な共分散を持つガウス事後分布近似を実行し、残りの重みは点推定のままにすることで、計算を効率化する。サブネットワークでは線形化ラプラス近似を用い、Wassersteinに基づく選択戦略を採用することで、深層アンサンブルと同等の精度の不確実性評価を達成し、より表現力が低い事後分布をもつ全ネットワークベイジアン手法を上回る。

ABSTRACT

The Bayesian paradigm has the potential to solve core issues of deep neural networks such as poor calibration and data inefficiency. Alas, scaling Bayesian inference to large weight spaces often requires restrictive approximations. In this work, we show that it suffices to perform inference over a small subset of model weights in order to obtain accurate predictive posteriors. The other weights are kept as point estimates. This subnetwork inference framework enables us to use expressive, otherwise intractable, posterior approximations over such subsets. In particular, we implement subnetwork linearized Laplace as a simple, scalable Bayesian deep learning method: We first obtain a MAP estimate of all weights and then infer a full-covariance Gaussian posterior over a subnetwork using the linearized Laplace approximation. We propose a subnetwork selection strategy that aims to maximally preserve the model's predictive uncertainty. Empirically, our approach compares favorably to ensembles and less expressive posterior approximations over full networks. Our proposed subnetwork (linearized) Laplace method is implemented within the laplace PyTorch library at https://github.com/AlexImmer/Laplace.

研究の動機と目的

  • 高次元の重み空間に起因する大規模なディープニューラルネットワークにおけるベイジアン推論の非可解性に対処すること。
  • ディープラーニングモデルの分布シフトに対する不確実性のキャリブレーションと耐性を向上させること。
  • ベイジアン推論を小さな重要な重みサブセットに集中させることで、計算コストを削減しながら予測不確実性を維持すること。
  • 表現力のある事後分布近似をサブネットワークに適用することで、全ネットワークベイジアン手法やディープアンサンブルを上回る性能を達成できることを示すこと。

提案手法

  • まず、全ニューラルネットワークのすべての重みに対して最大事後確率(MAP)推定を実行する。
  • 予測不確実性を保持するために、Wasserstein距離に基づく基準を用いて、小さな代表的なサブネットワークの重みを選択する。
  • 線形化ラプラス近似を用いて、選択されたサブネットワーク上で完全共分散ガウス事後分布を推定する。
  • 残りの重みは固定された点推定のままにし、サブネットワーク事後分布の周辺化により効率的な予測を可能にする。
  • サブネットワーク選択の段階では、スケーラビリティを高めるために対角近似が用いられ、事後分布品質への影響を最小限に抑える。
  • 最終的な予測は、全ネットワークのアーキテクチャとサブネットワーク上のベイジアン事後分布の組み合わせにより、不確実性を考慮した推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1小さな重みサブセットにおけるベイジアン推論が、全ニューラルネットワークの予測不確実性を保持できるか?
  • RQ2表現力のある事後分布近似をサブネットワークに適用したサブネットワーク推論が、表現力が低い全ネットワークベイジアン手法を上回るか?
  • RQ3サブネットワークベースのアプローチが、ディープアンサンブルの不確実性キャリブレーションに匹敵または上回るか?
  • RQ4サブネットワーク選択戦略の選択が、事後分布品質および不確実性推定に与える影響は何か?
  • RQ5サブネットワーク選択段階で近似を施すほうが、事後分布推定段階で近似を施すよりも効率的かつ効果的か?

主な発見

  • 提案されたサブネットワーク(線形化)ラプラス法は、ベイジアン推論に使用する重みの割合が極めて少ないにもかかわらず、ディープアンサンブルと同等の不確実性キャリブレーションと分布シフトに対する耐性を達成する。
  • 対角または因子化された事後分布をもつ全ネットワークベイジアン手法よりも優れた性能を示し、サブネットワークに表現力のある事後分布近似を適用するほうが、全ネットワークに表現力が低い近似を適用するよりも効果的であることを実証した。
  • 全ネットワークとサブネットワークの事後分布間のWasserstein距離に基づくサブネットワーク選択は、選択段階で対角近似を使用しても、不確実性の保持を著しく向上させる。
  • 低次元部分空間における完全共分散事後分布推定を可能にすることで、大規模モデルに対しても計算的に実行可能でありながら、高い予測精度を維持する。
  • MNIST、CIFAR10、Fashion-MNIST、SVHN、およびテーブル形式のUCIデータセットにおける実験結果から、ベースラインのベイジアン手法やアンサンブル手法と比較して、優れたキャリブレーションと耐性が確認された。
  • Laplace PyTorchライブラリを用いて効率的な実装がなされており、再現性が保たれ、既存のディープラーニングワークフローへの統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。