[論文レビュー] Improving predictions of Bayesian neural nets via local linearization
本論文は、元のBNNの代わりに一般化ガウス・ノイマン(GGN)近似から導出された局所線形化モデルを用いる「GLM予測」手法を提案する。この手法は、MAP推定周辺でBNNを一般化線形モデル(GLM)として扱うことで、特にアンダーフィッティングの低減と分布外(OOD)検出の向上に寄与し、複数のデータセットにおいて標準的なBNNおよびMAP予測と比較して一貫した性能向上を達成する。
The generalized Gauss-Newton (GGN) approximation is often used to make practical Bayesian deep learning approaches scalable by replacing a second order derivative with a product of first order derivatives. In this paper we argue that the GGN approximation should be understood as a local linearization of the underlying Bayesian neural network (BNN), which turns the BNN into a generalized linear model (GLM). Because we use this linearized model for posterior inference, we should also predict using this modified model instead of the original one. We refer to this modified predictive as "GLM predictive" and show that it effectively resolves common underfitting problems of the Laplace approximation. It extends previous results in this vein to general likelihoods and has an equivalent Gaussian process formulation, which enables alternative inference schemes for BNNs in function space. We demonstrate the effectiveness of our approach on several standard classification datasets as well as on out-of-distribution detection. We provide an implementation at https://github.com/AlexImmer/BNN-predictions.
研究の動機と目的
- 一般化ガウス・ノイマン(GGN)近似を用いたラプラス近似におけるBNNで一般的に観察されるアンダーフィッティング問題を解消すること。
- ベイジアンニューラルネットワークにおける事後分布近似と予測推論の不一致を解消すること。
- 線形化モデルに基づく予測分布の再定義により、不確実性の補正精度と分布外(OOD)検出を向上させること。
- ガウス過程の同等形式を可能にする、モデルに依存しない原理的枠組みを提供すること。
- 元のBNNではなく線形化モデル(GLM)を予測に用いることで、実験的に優れた性能が得られることを示すこと。
提案手法
- GGN近似を、MAP推定周辺でのBNNの局所線形化と解釈し、元の非線形モデルを一般化線形モデル(GLM)に変換する。
- この線形化GLMに対してラプラス近似を用いて事後分布推論を実施し、パラメータの近似事後分布を効率的に計算可能にする。
- 予測分布は、元のBNNではなく線形化GLMの特徴量を用いて計算され、これが「GLM予測」分布となる。
- GLM予測は関数空間においてガウス過程と同等であることが示され、カーネル法による代替推論手法の利用が可能になる。
- ガウス分布および非ガウス分布の尤度(シグモイドおよびソフトマックス出力含む)を用いた分類および回帰タスクに本手法を適用する。
- 標準ベンチマーク(MNIST、FMIST、CIFAR10)を用いて評価し、予測エントロピーおよびAUCスコアを用いて分布外(OOD)検出をテストする。
実験結果
リサーチクエスチョン
- RQ1元のBNNではなく線形化モデル(GLM)を予測に用いることで、予測性能が向上し、アンダーフィッティングが低減するか?
- RQ2GLM予測は、標準的なBNN予測およびMAP推論と比較して、精度、補正精度、OOD検出においてどのように異なるか?
- RQ3GLM予測はガウス分布以外の尤度に対しても一般化可能か?
- RQ4GLM予測の関数空間における同等のガウス過程形式は存在するか? また、これにより代替推論手法が可能になるか?
- RQ5GLM予測は、多様なアーキテクチャおよびデータセットにおいて一貫して既存のベースラインを上回るか?
主な発見
- GLM予測は、MNIST(92.24% vs. 92.12%)およびCIFAR10(77.44% vs. 77.38%)において標準BNN予測よりも高い精度を達成し、負の対数尤度(NLL)と期待補正誤差(ECE)が低減された。
- MNIST/Fashion-MNISTのOOD検出タスクにおいて、GLM予測はOOD-AUC 0.947を達成し、BNN予測(0.905)およびMAP(0.892)を上回った。
- GLM予測はNLLおよびECEの観点で、常にBNN予測を上回り、MNISTではECEが20%低減、CIFAR10では30%低減された。
- GLM予測は、全テストアーキテクチャおよびデータセットでOOD検出において最良の性能を示し、MNIST/Fashion-MNISTおよびCIFAR10/SVHNペアで最高のAUCスコアを記録した。
- GLM予測のガウス過程同等形式は、補正精度およびOOD検出を向上させ、理論的同等性を確認するとともに、代替推論手法の利用を可能にした。
- [undefah]の減衰事後分布を用いても、本手法は依然として多くの指標でBNN予測を上回り、特にOOD検出において顕著な優位性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。