Skip to main content
QUICK REVIEW

[論文レビュー] Radial Bayesian Neural Networks: Beyond Discrete Support In Large-Scale Bayesian Deep Learning

Sebastian Farquhar, Michael A. Osborne|arXiv (Cornell University)|Jul 1, 2019
Gaussian Processes and Bayesian Inference参考文献 29被引用数 21
ひとこと要約

この論文は、ハイパースペース上の径路的分布に置き換えることで、平均場ガウス事後分布を改善する変分推論手法であるRadial BNN(径路的ベイジアンニューラルネットワーク)を提案する。この手法により、高次元ガウス分布の特徴的「 soapy-bubble 」病態を回避し、重み空間全体にわたるサポートを実現するとともに、勾配の分散を低減する。大規模な医療画像認識タスクにおいて、ハイパーパramータチューニングなしでMCドロップアウトやディープアンサンブルを凌駕する性能を発揮する。

ABSTRACT

We propose Radial Bayesian Neural Networks (BNNs): a variational approximate posterior for BNNs which scales well to large models while maintaining a distribution over weight-space with full support. Other scalable Bayesian deep learning methods, like MC dropout or deep ensembles, have discrete support-they assign zero probability to almost all of the weight-space. Unlike these discrete support methods, Radial BNNs' full support makes them suitable for use as a prior for sequential inference. In addition, they solve the conceptual challenges with the a priori implausibility of weight distributions with discrete support. The Radial BNN is motivated by avoiding a sampling problem in 'mean-field' variational inference (MFVI) caused by the so-called 'soap-bubble' pathology of multivariate Gaussians. We show that, unlike MFVI, Radial BNNs are robust to hyperparameters and can be efficiently applied to a challenging real-world medical application without needing ad-hoc tweaks and intensive tuning. In fact, in this setting Radial BNNs out-perform discrete-support methods like MC dropout. Lastly, by using Radial BNNs as a theoretically principled, robust alternative to MFVI we make significant strides in a Bayesian continual learning evaluation.

研究の動機と目的

  • 高次元ガウス分布からのサンプルが平均から代表的でないことが原因となる、平均場変分推論(MFVI)における病理的「 soapy-bubble 」効果を是正すること。
  • 重み空間全体にわたるサポートを持つスケーラブルなベイジアンニューラルネットワーク手法を開発し、MCドロップアウト やディープアンサンブルのような離散的サポートを持つ手法を回避すること。
  • 現実世界の大規模なディープラーニングタスク(例:医療画像分類)に適した、ハイパーパramータに依存しないロバストな推論手法を構築すること。
  • 継続的学習におけるデータに依存する事前分布として、BNN事後分布を効果的に使用できることを実現すること。

提案手法

  • 各ネットワーク層に対して、ハイパースペース上に径路的近似事後分布を提案し、径路的基底関数を介して重み空間に変換する。
  • 単位球面上の分布として事後分布を定義し、径路的成分を1変量分布(例:ガンマ分布や逆ガンマ分布)から抽出することで、サンプルが平均に近づくように保証する。
  • 座標変換を明示的に行わずに、効率的な学習を可能にするためのELBO(下界の期待値)の解析的表現を導出する。
  • ベースライン比較として、MFVIにおけるガウス事前分布の打ち切りに再帰的サンプリング(rejection sampling)を用い、低分散推定器が性能向上に寄与することを示す。
  • 標準的なディープラーニングフレームワークを用いて実装し、MFVIと同等の学習速度と実装の簡便性を維持する。
  • 高次元入力(約23万次元)を持つ1500万パラメータのモデルを用い、糖尿病網膜症検出タスクにこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1径路的事後分布は、高次元平均場変分推論における「 soapy-bubble 」病態を緩和できるか?
  • RQ2完全なサポートを持つ事後分布は、大規模なベイジアンディープラーニングにおけるハイパーパramータ選択に対するロバストネスを向上させるか?
  • RQ3Radial BNNは、現実世界の高次元医療画像認識タスクにおいて、MCドロップアウト やディープアンサンブルといった最先端手法を凌駆できるか?
  • RQ4Radial BNNの事後分布は、継続的学習設定において効果的で、データに依存する事前分布として機能できるか?
  • RQ5性能の向上は、より代表的な事後分布サンプルによる勾配分散の低減に起因するのか?

主な発見

  • 実世界の糖尿病網膜症分類タスクにおいて、Radial BNNはMCドロップアウト やディープアンサンブルを上回り、より低いテストRMSEと高い予測対数尤度を達成する。
  • UCI回帰ベンチマークにおいて、Radial BNNは最先端の性能を達成し、Wineデータセットでは平均テストRMSE 0.64 ± 0.01、Kin8nmでは0.07 ± 0.00を記録し、MFVIや他のベースラインを上回る。
  • ハイパーパramータの選択に対して頑健であり、異なる重み初期化分散や学習率においても安定した性能を示す。
  • 打ち切られたMFVI(再帰的サンプリングを用いて)は性能が向上するが、依然としてRadial BNNに劣り、MFVIの根本的問題が高分散推定に起因することを示唆する。
  • Radial BNNは重み空間全体にわたる完全なサポートを維持しており、継続的学習において、離散的サポートを持つ手法よりも、崩壊的忘却(catastrophic forgetting)をより効果的に防ぐ事前分布として利用可能である。
  • 解析的ELBO導出により、標準的なMFVIと同等の効率で学習が可能であり、追加の計算コストは一切ない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。