Skip to main content
QUICK REVIEW

[論文レビュー] Global inducing point variational posteriors for Bayesian neural networks and deep Gaussian processes

Sebastian W. Ober, Laurence Aitchison|arXiv (Cornell University)|May 17, 2020
Gaussian Processes and Bayesian Inference参考文献 64被引用数 17
ひとこと要約

本論文は、入力層に位置するグローバルな誘導点を学習し、それをネットワーク全体に伝播させることで、層間相関をモデル化する、ベイジアンニューラルネットワーク(BNNs)およびディープガウス過程(DGPs)のグローバル誘導点変分後測度を提案する。この手法は、データオーグメンテーションや温度調整なしでCIFAR-10で86.7%の精度を達成し、変分法における最先端性能を達成しており、標準的な局所的誘導点手法を上回り、SGMCMC性能に近づく。

ABSTRACT

We consider the optimal approximate posterior over the top-layer weights in a Bayesian neural network for regression, and show that it exhibits strong dependencies on the lower-layer weights. We adapt this result to develop a correlated approximate posterior over the weights at all layers in a Bayesian neural network. We extend this approach to deep Gaussian processes, unifying inference in the two model classes. Our approximate posterior uses learned "global" inducing points, which are defined only at the input layer and propagated through the network to obtain inducing inputs at subsequent layers. By contrast, standard, "local", inducing point methods from the deep Gaussian process literature optimise a separate set of inducing inputs at every layer, and thus do not model correlations across layers. Our method gives state-of-the-art performance for a variational Bayesian method, without data augmentation or tempering, on CIFAR-10 of 86.7%, which is comparable to SGMCMC without tempering but with data augmentation (88% in Wenzel et al. 2020).

研究の動機と目的

  • 標準的な変分推論が層間で独立した後測度を仮定し、層間相関を捉えられないという限界を解消すること。
  • 同じ後測度構造を両モデルクラスに拡張することで、BNNsおよびDGPsのための統一的推論フレームワークを構築すること。
  • 各層ごとに別々に最適化するのではなく、ネットワーク全体にわたって伝播するグローバル誘導点を学習することで、ベイジアンディープラーニングにおける予測性能を向上させること。
  • スケーラブルで効率的な手法を提供し、高い精度を標準ベンチマークで達成しながら、強力な不確実性評価を維持すること。

提案手法

  • 本手法は、上位層の重みに関する最適な近似後測度を、上位層の表現におけるベイジアン線形回帰によって導出し、自然に層間相関を生じさせる。
  • 各層に学習された「擬似出力」を導入し、下位層からの入力をそれらの擬似出力へと伝播させるベイジアン線形回帰を用いて、重みの後測度を定義する。
  • グローバル誘導点は入力層でのみ定義され、ネットワーク全体に伝播して深層の層での誘導入力を生成する。これにより、各層での誘導入力の最適化を回避する。
  • 本手法は、局所的な重みだけでなく、ネットワーク全体の下位層表現に依存する構造的後測度を用いた変分推論フレームワークを採用する。
  • 畳み込み層に対しては、計算的妥当性を保ちながらもグローバル構造を維持する効率的実装を含む。
  • 各層をグローバル誘導点を備えたガウス過程として扱うことで、DGPsへの拡張を実現し、BNNsおよびDGPs間の推論を統一する。

実験結果

リサーチクエスチョン

  • RQ1入力層から伝播するグローバル誘導点戦略は、局所的・層別誘導点と比較して、ベイジアンニューラルネットワークにおける後測度近似を改善できるか?
  • RQ2後測度における層間相関をモデル化することは、深層モデルの予測性能および不確実性キャリブレーションにどのように影響するか?
  • RQ3同じ変分後測度構造をBNNsおよびDGPsの両方に効果的に適用でき、統一的推論フレームワークを実現できるか?
  • RQ4特にCIFAR-10のような画像分類ベンチマークにおいて、非温度調整・データオーグメンテーションなしの環境下での本手法の性能はいかがなものか?

主な発見

  • 提案手法は、データオーグメンテーションや温度調整なしの変分ベイジアンニューラルネットワークを用いてCIFAR-10で86.7%のテスト精度を達成し、変分法における最先端性能を達成した。
  • 本手法は、エネルギー、海軍、パワーデータセットを含む複数の回帰データセットにおいて、標準的な局所的誘導点アプローチを上回る有意なELBOスコアを達成した。
  • エネルギーデータセットでは、グローバル誘導点手法が1.48のELBOを達成したのに対し、局所的誘導点は1.47であった。これは一貫した改善を示している。
  • 海軍データセットでは、深さ2のとき、グローバル誘導点手法がELBO3.89を達成したのに対し、局所的誘導点は3.01であった。これはモデル表現力の顕著な向上を示している。
  • グローバル誘導点アプローチは、タンパク質やワインなどの回帰タスクにおいても低いネガティブ・ログリクライム値を示し、優れた不確実性キャリブレーションを維持している。
  • 本手法は、BNNsおよびDGPsの両方のための統一的推論フレームワークを可能にし、同じ後測度構造が両モデルクラスに一貫して適用可能で、性能向上をもたらすことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。