[論文レビュー] Bayesian Neural Network Ensembles
本稿では、事前分布から抽出した重みの周囲でパラメータ正則化を行うランダム化MAPサンプリングを用いたベイジアンニューラルネットワークアンサンブル手法を提案する。この手法により、広大なネットワークにおいて一貫性のある事後予測サンプルが得られる。正規分布からのi.i.d.抽出を用いて事前分布の平均にノイズを注入することで、回帰タスクにおいてMCMCやVI、MCドロップアウトといった近似ベイジアン手法や標準アンサンブル法を上回る、正確な不確実性推定が、5〜10個のモデルのみで達成可能となる。
Ensembles of neural networks (NNs) have long been used to estimate predictive uncertainty; a small number of NNs are trained from different initialisations and sometimes on differing versions of the dataset. The variance of the ensemble's predictions is interpreted as its epistemic uncertainty. The appeal of ensembling stems from being a collection of regular NNs - this makes them both scalable and easily implementable. They have achieved strong empirical results in recent years, often presented as a practical alternative to more costly Bayesian NNs (BNNs). The departure from Bayesian methodology is of concern since the Bayesian framework provides a principled, widely-accepted approach to handling uncertainty. In this extended abstract we derive and implement a modified NN ensembling scheme, which provides a consistent estimator of the Bayesian posterior in wide NNs - regularising parameters about values drawn from a prior distribution.
研究の動機と目的
- コストの高いMCMCや変分推論を回避する、スケーラブルで実用的なベイジアンニューラルネットワーク推論手法の開発。
- 深層学習における実証的アンサンブル手法と原理的ベイジアン不確実性推定の間のギャップを埋めること。
- 適切にキャリブレーションされたノイズを用いたランダム化MAPサンプリングが、広大なニューラルネットワークにおいて真の事後分布を一貫して近似できることを示すこと。
- 予測空間における不確実性を効果的に捉えるために、わずか5〜10個のモデルで十分であることを実証すること。
提案手法
- 本手法は、ランダムに抽出された事前分布平均の周囲でネットワークパラメータを正則化する修正された損失関数を用いる。定義は $\text{Loss}_{\text{anchor}} = \frac{1}{N}\|\mathbf{y}-\hat{\mathbf{y}}\|_2^2 + \frac{1}{N}\|\boldsymbol{\Gamma}^{1/2}(\boldsymbol{\theta}-\boldsymbol{\theta}_0)\|_2^2$ であり、$\boldsymbol{\theta}_0 \sim \mathcal{N}(\boldsymbol{\mu}_{\text{prior}}, \boldsymbol{\Sigma}_{\text{prior}})$ である。
- 事前分布平均 $\boldsymbol{\theta}_0$ のノイズ分布は、得られるMAP推定値が正しい事後分布の平均と分散を持つように導出される。その際、$\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}} + \boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$ が成り立つ。
- 広大なニューラルネットワークでは、項 $\boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$ が消えるため、$\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}}$ を有効な近似として用いることができる。
- アンサンブル内の各モデルは、異なる $\boldsymbol{\theta}_0$ を用いてアンカーロスを最小化することで独立に訓練され、事後予測分布からのi.i.d.サンプルが得られる。
- 非線形モデルでは複雑で一貫性のないため、尤度(例:ターゲット)にノイズを注入するのを避けており、代わりに事前分布平均のみをノイズ源として焦点を当てる。
- 本手法は、広大なネットワークにおいて事後分布が事前分布に支配されるという仮定の下で理論的に正当化される。この仮定は、過パラメータ化されたベイジアンニューラルネットワークにおいて成立する。
実験結果
リサーチクエスチョン
- RQ1ランダム化MAPサンプリングに事前分布平均にノイズを注入することで、広大なベイジアンニューラルネットワークにおいて真の事後分布の一貫した推定が可能か?
- RQ2予測空間における信頼性の高い不確実性推定を達成するために、アンサンブルに必要なモデル数はどの程度か?
- RQ3標準アンサンブル手法が分布外領域でエピステミック的不確実性を捉えられない理由は何か?そして、適切な事前分布正則化によってこの問題を是正できるか?
- RQ4MCMCや変分推論を必要とせず、ゴールスタンダードのベイジアン推論(例:HMCやGP)を単純でスケーラブルな手法で近似できるか?
- RQ5本手法は、VI や MCドロップアウトといった既存のスケーラブルなベイジアンディープラーニング手法に比べ、パラメータ相関や予測不確実性をより良く捉えられるか?
主な発見
- 提案手法は、ReLU、シグモイド、RBF活性化関数を用いたトロイ回帰問題において、ハミルトニアンモンテカルロやガウス過程によるゴールスタンダードと類似した予測分布を生成した。
- 本手法は、平均場VIやMCドロップアウトに比べ、特に補間領域においてエピステミック的不確実性をよりよく捉えており、パラメータ相関をモデル化できる能力に起因する。
- 分散のやや過大評価があるものの、本手法は真の事後予測分布の質的に正確な近似を提供している。
- わずか5〜10個のモデルで十分な不確実性推定が達成可能であり、この数は入力・出力次元に依存しない。
- 本手法は、分布外領域におけるRBFガウス過程の挙動を正しく再現しており、特に学習データから離れた領域では高信頼度のゼロ予測を示している。
- 10の標準ベンチマークデータセットにおいて、エピステミック的不確実性が支配的であるタスクで、Deep Ensemblesを上回る不確実性評価性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。