[論文レビュー] Hierarchical Gaussian Process Priors for Bayesian Neural Network Weights
本稿は、ユニットレベルの潜在変数を用いて相関のある重み構造をモデル化する階層的ガウス過程事前分布を導入し、カーネル関数を介して入力依存の事前分布を実現することで、柔軟なインダクティブバイアスと、分布外データにおける優れた不確実性評価を可能にする。この手法は、DKL や MAP 評価を含む強力なベースラインを上回る性能を示し、不確実性評価とアクティブラーニングの両面で優れた結果を達成する。
Probabilistic neural networks are typically modeled with independent weight priors, which do not capture weight correlations in the prior and do not provide a parsimonious interface to express properties in function space. A desirable class of priors would represent weights compactly, capture correlations between weights, facilitate calibrated reasoning about uncertainty, and allow inclusion of prior knowledge about the function space such as periodicity or dependence on contexts such as inputs. To this end, this paper introduces two innovations: (i) a Gaussian process-based hierarchical model for network weights based on unit embeddings that can flexibly encode correlated weight structures, and (ii) input-dependent versions of these weight priors that can provide convenient ways to regularize the function space through the use of kernels defined on contextual inputs. We show these models provide desirable test-time uncertainty estimates on out-of-distribution data, demonstrate cases of modeling inductive biases for neural networks with kernels which help both interpolation and extrapolation from training data, and demonstrate competitive predictive performance on an active learning benchmark.
研究の動機と目的
- ベイジアンニューラルネットワークにおける独立な重み事前分布の限界を解決すること。これには、重み間の相関を捉えられず、関数的インダクティブバイアスを表現するためのコンactなインターフェースが欠如している。
- パラメータ効率的かつ構造化された重み事前分布を構築し、補正された不確実性推定と、周期性や入力コンテキストといった事前知識の統合を可能にすること。
- 文脈入力上のカーネルに基づく構成により、関数空間の振る舞いを正則化しつつ重み構造を保持する、入力依存の重み事前分布を実現すること。
- 高次元の重み空間における直接的な推論を避ける一方で、重み間の相関を維持する効率的な変分推論スキームを設計すること。
- 強力なベースラインと比較して、補間・外挿・不確実性推定・アクティブラーニングの各分野で、性能の向上を示すこと。
提案手法
- 各重み $w_{l,i,j}$ が、連結された潜在コード $[\mathbf{z}_{l,i}, \mathbf{z}_{l+1,j}]$ から関数 $f$ を介して生成される、ユニットレベルの潜在変数 $\mathbf{z}_{l,i}$ を用いた階層的事前分布を提案する。
- 潜在コードから重みの平均を生成するメタネットワーク(ハイパーネットワーク)$\mathrm{NN}_\theta$ を用い、ガウスノイズモデル $p(\mathbf{w}|\mathbf{C}_w(\mathbf{z}), \theta) = \mathcal{N}(\mathbf{w}|\mathrm{NN}_\theta(\mathbf{C}_w(\mathbf{z})))$ を定式化する。
- ユニット潜在変数 $\mathbf{z}$ に対してグローバルな GP 事前分布を導入し、$p(\mathbf{z}) = \prod \mathcal{N}(\mathbf{z}_{l,i}; \mathbf{0}, \mathbf{I})$ とすることで、重み間の構造的相関モデリングを可能にする。
- 文脈入力上でのローカルカーネル $k_{\text{local}}$ を定義することで、入力依存の事前分布を拡張し、各データポイントごとに異なる事前分布を実現し、関数的インダクティブバイアスを表現可能にする。
- 高次元の重み空間における直接的な推論を避けるために、潜在変数 $\mathbf{z}$ の周辺事後分布を近似する構造化された変分推論を採用し、重み間の相関を維持する。
- グローバルおよびローカルカーネルを組み合わせた積カーネル構成を用いることで、入力依存の重み事前分布および関数的性質を柔軟にモデル化する。
実験結果
リサーチクエスチョン
- RQ1ユニットレベルの潜在変数に対する階層的 GP 事前分布は、ベイジアンニューラルネットワークにおける相関のある重み構造を効果的にモデル化できるか?
- RQ2文脈入力上でのカーネルに基づく入力依存の重み事前分布は、関数空間における一般化性と不確実性の補正性を向上させられるか?
- RQ3提案された構造化された変分推論戦略は、重み間の相関を維持し、平均場近似と比較して予測性能および不確実性推定において優れた結果を出すか?
- RQ4情報量の多い構造的事前分布と不確実性に配慮した選択基準を活用することで、アクティブラーニングの性能が向上するか?
- RQ5分布外データにおける不確実性評価の観点から、DKL や MAP といった強力なベースラインと比較して、本モデルはどのように性能を発揮するか?
主な発見
- 提案された MetaGP モデルは、DKL や MAP を含むすべての比較モデルと比較して、分布外データにおける不確実性推定を著しく改善している。特に、これらのベースラインは予測が過信になりがちである。
- Kuzushiji-MNIST データセットでは、予測エントロピーが分布内と分布外のサンプルを明確に区別でき、不確 Promise の補正性が優れていることが示された。
- UCI レグレッションデータセットにおけるアクティブラーニングでは、MetaGP モデルは平均場 VI と同等またはそれ以上の予測性能を達成しながら、少ないクエリ数で実現しており、不確実性に基づく効果的なサンプリングが可能であることが示された。
- MAP 評価は、分布内テストセットでは良好な性能を示すものの、分布外データでは一貫して不確実性推定が劣悪であることが判明しており、MetaGP が顕著に優位である。
- 構造化された変分推論アプローチは、重み間の相関を効果的に維持し、高次元の重み空間における直接的な事後分布推論を避けることで、効率的な学習を可能にした。
- 入力依存の事前分布に積カーネルを用いることで、周期性やコンテキスト依存性といった関数的インダクティブバイアスをモデルに組み込むことができ、補間および外挿性能の両方が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。