[論文レビュー] Compromise-free Bayesian neural networks
本稿では、正確なネストド・サブセットリングを用いて完全で非ガウス型の事後分布を数値的にサンプリングし、モデル比較のための正確なベイズ的証拠(周辺尤度)を計算する、妥協のないベイズ的ニューラルネットワーク(BNN)を提案する。ベイズ的証拠と汎化性能の間に強い相関が見られ、ReLUネットワークが一貫してtanhネットワークを上回ることを示し、異なるアーキテクチャにわたるBNNのアンサンブル化により、個々のモデルを上回る予測精度が得られることを示している。
We conduct a thorough analysis of the relationship between the out-of-sample performance and the Bayesian evidence (marginal likelihood) of Bayesian neural networks (BNNs), as well as looking at the performance of ensembles of BNNs, both using the Boston housing dataset. Using the state-of-the-art in nested sampling, we numerically sample the full (non-Gaussian and multimodal) network posterior and obtain numerical estimates of the Bayesian evidence, considering network models with up to 156 trainable parameters. The networks have between zero and four hidden layers, either $ anh$ or $ReLU$ activation functions, and with and without hierarchical priors. The ensembles of BNNs are obtained by determining the posterior distribution over networks, from the posterior samples of individual BNNs re-weighted by the associated Bayesian evidence values. There is good correlation between out-of-sample performance and evidence, as well as a remarkable symmetry between the evidence versus model size and out-of-sample performance versus model size planes. Networks with $ReLU$ activation functions have consistently higher evidences than those with $ anh$ functions, and this is reflected in their out-of-sample performance. Ensembling over architectures acts to further improve performance relative to the individual BNNs.
研究の動機と目的
- ベイズ的ニューラルネットワークにおけるベイズ的証拠と汎化性能の関係を調査すること。
- 活性化関数(ReLU 対 tanh)、ネットワークの深さ、階層的事前分布の影響がモデル証拠および予測性能に与える影響を評価すること。
- 個々のBNNのベイズ的証拠に基づいて再重み付けを行うアンサンブル手法を開発・検証し、一般化性能の向上を図ること。
- 最先端のネストド・サブセットリングを用いて、近似を伴わないきめ細やかなBNN性能ベンチマークを提供すること。
- 妥協のないBNNと、正則化なしに通常のバックプロパゲーションで訓練された従来のニューラルネットワーク(TNN)との性能を比較すること。
提案手法
- 本研究では、最大156個のトレーニング可能なパラメータを有するBNNの完全で非ガウス的かつマルチモーダルな事後分布を数値的にサンプリングするために、PolyChordネストド・サブセットリングアルゴリズムを採用する。
- ベイズ的証拠(周辺尤度)は、ネストド・サブセットリングの出力から直接計算され、ガウス近似やラプラス近似を用いずに正確なモデル比較が可能になる。
- ネットワークは、0〜4層の隠れ層、ReLUまたはtanh活性化関数、および異なる階層的事前分布構造(入力、層、または変数ハイパーパrameterの粒度)を用いて訓練される。
- アンサンブルは、個々のネットワークの事後分布サンプルを、それぞれのベイズ的証拠値に基づいて再重み付けすることで構築され、モデル平均化された予測分布が得られる。
- 個々のBNNおよびそのアンサンブルの性能は、10回のランダムなデータ分割を用いたボストン住宅データセット上で評価され、主な指標としてテスト損失とベイズ的証拠が用いられる。
- ベースライン比較として、正則化なしにAdam最適化で訓練された従来のニューラルネットワーク(TNN)を、同じアーキテクチャとデータ分割を用いて用いる。
実験結果
リサーチクエスチョン
- RQ1ベイズ的ニューラルネットワークにおいて、ベイズ的証拠と汎化性能の間には強い相関が存在するか?
- RQ2ReLU活性化を用いたBNNは、tanh活性化を用いたBNNと比較して、常に高いベイズ的証拠と優れたテスト性能を達成するか?
- RQ3ベイズ的証拠に基づいて再重み付けされたBNNのアンサンブルは、個々のBNNと比較して予測性能にどのように影響を与えるか?
- RQ4異なる階層的事前分布構造(ハイパーパrameterの粒度)は、モデル証拠および一般化性能にどのように影響を与えるか?
- RQ5正則化なしにバックプロパゲーションで訓練された従来のニューラルネットワーク(TNN)と比較して、妥協のないBNNの性能はどの程度か?
主な発見
- すべてのBNNアーキテクチャにおいて、ベイズ的証拠と汎化性能の間に強い正の相関が確認され、証拠が信頼できるモデル選択基準であることが妥当化された。
- ReLU活性化を用いたBNNは、tanh活性化を用いたBNNと比較して、顕著に高いベイズ的証拠と低いテスト損失を達成しており、最良のReLUモデルではテスト損失が0.1732に達した。
- 特に層の粒度を持つハイパーパrameterを用いて訓練されたモデルを異なるアーキテクチャにわたってアンサンブル化することで、テスト損失が0.1732に低下し、最良の個別BNN(0.1791)を上回った。
- 層の粒度を持つハイパーパラメータで訓練されたすべてのモデルのアンサンブルは、最低のテスト損失を達成し、証拠に基づく重み付けアンサンブルが一般化性能を向上させることを示した。
- 変数ハイパーパラメータを有するすべてのBNNは、それに対応するTNNの性能を上回ったが、TNNではtanh活性化関数を用いたものがReLUを用いたものよりも多くの場合で優れており、ベイズ的正則化の利点を強調した。
- 結合モデルのベイズ的証拠値は、個々のモデルの間にあることが確認され、モデル平均化の下で証拠が線形に結合されることを裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。