Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Hypernetworks

David Krueger, Chin-Wei Huang|arXiv (Cornell University)|Oct 13, 2017
Gaussian Processes and Bayesian Inference参考文献 22被引用数 16
ひとこと要約

この論文は、深層ニューラルネットワークの重みに対する複雑で相関のある多次元の近似事後分布を生成するために可逆なハイパーネットワークを用いる変分推論フレームワーク、ベイジアンハイパーネットワーク(BHNs)を導入する。正規化フローを介して効率的なサンプリングと正確なエントロピー推定を可能にすることで、BHNsはドロップアウトなどの標準的手法に比べ、不確実性のキャリブレーション、敵対的ロバストネス、異常検出の面で優れた性能を発揮する。

ABSTRACT

We study Bayesian hypernetworks: a framework for approximate Bayesian inference in neural networks. A Bayesian hypernetwork $\h$ is a neural network which learns to transform a simple noise distribution, $p(\vecε) = \N(\vec 0,\mat I)$, to a distribution $q(\pp) := q(h(\vecε))$ over the parameters $\pp$ of another neural network (the "primary network")\@. We train $q$ with variational inference, using an invertible $\h$ to enable efficient estimation of the variational lower bound on the posterior $p(\pp | \D)$ via sampling. In contrast to most methods for Bayesian deep learning, Bayesian hypernets can represent a complex multimodal approximate posterior with correlations between parameters, while enabling cheap iid sampling of~$q(\pp)$. In practice, Bayesian hypernets can provide a better defense against adversarial examples than dropout, and also exhibit competitive performance on a suite of tasks which evaluate model uncertainty, including regularization, active learning, and anomaly detection.

研究の動機と目的

  • ベイジアンディープラーニングにおける一様で因子分解された変分事後分布の限界を解決すること。これらはしばしば不確実性を低く見積もっており、複雑なパrameter間の依存関係を捉えられない。
  • 深層ニューラルネットワークにおける近似ベイズ推論のためのスケーラブルで効率的な手法を開発し、モデルパラメータにわたる豊富で相関のある事後分布をサポートすること。
  • アクティブラーニング、異常検出、敵対的例防御など、安全性が求められる応用分野におけるモデルの不確実性推定を改善すること。
  • ベイジアンハイパーネットワークが、MCドロップアウトなどの標準的手法に比べ、不確実性の定量化および分布シフトや敵対的攻撃に対するロバストネスにおいて優れていることを実証すること。

提案手法

  • 単純なノイズ事前分布 $ \mathcal{N}(\mathbf{0}, \mathbf{I}) $ を可逆なハイパーネットワーク $ h $ を用いて、主ネットワークのパラメータ $ \boldsymbol{\theta} $ における複雑で柔軟な事後分布 $ q(\boldsymbol{\theta}) = q(h(\boldsymbol{\epsilon})) $ に写像する。
  • 正規化フロー(特にRealNVPやIAFのような可逆カップリング層)を活用して、ハイパーネットワークが可逆かつ微分可能であることを保証し、変分下界における対数尤度およびエントロピー項の正確な計算を可能にする。
  • 変分下界(ELBO)の最小化によりハイパーネットワークを学習する。この際、サンプリング時の測度変化を補正するため、$ h $ のヤコビアン行列式の対数が用いられる。
  • ノイズ $ \boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \mathbf{I}) $ をサンプリングし、それを $ h $ を通すことで、MCMC や拒否サンプリングを避けて、$ q(\boldsymbol{\theta}) $ からの効率的かつ独立同分布(iid)のサンプリングを実現する。
  • ハイパーネットワークのアーキテクチャをパラメータ効率的かつ大規模な主ネットワークにスケーラブルにすることにより、ベイジアンディープラーニングにおけるハイパーネットワークベース手法の従来の限界を克服する。
  • 複数回の主ネットワークへの順方向伝搬により、$ q(\boldsymbol{\theta}) $ からの異なる $ \boldsymbol{\theta} $ サンプルを用いて予測不確実性をモンテカルロ推定することで、不確実性を考慮した予測を可能にする。

実験結果

リサーチクエスチョン

  • RQ1可逆なハイパーネットワークを用いて、深層ニューラルネットワークの重みに対して複雑で多次元的かつ相関のある近似事後分布をパラメータ化できるか。また、そのようなアプローチが効率的なサンプリングと学習を可能にするか。
  • RQ2可逆なハイパーネットワークの使用により、ガウス分布やドロップアウトのような標準的な変分近似に比べ、より正確でキャリブレーションされた不確実性推定が可能になるか。
  • RQ3ベイジアンハイパーネットワークは、分布外または摂動を加えた入力に対してエピステミック的不確実性を高めることで、敵対的例に対するロバストネスを向上させられるか。
  • RQ4アクティブラーニングや異常検出タスクにおいて、ベイジアンハイパーネットワークはMCドロップアウトや他のベイジアンベースラインに比べて性能に優れているか。
  • RQ5提案手法は、計算コストが著しく増大するリスクを伴わず、実世界のディープラーニングタスクに効果的にスケーリングできるか。

主な発見

  • 可逆なハイパーネットワーク(例:IAF や RealNVP)を用いたベイジアンハイパーネットワーク(BHNs)は、MCドロップアウトや標準的な変分推論に比べ、不確実性のキャリブレーションが著しく優れている。特に、敵対的例の検出において顕著な改善を示す。
  • MNISTおよびCIFAR-10データセットにおいて、IAFハイパーネットワークを用いたBHNsは、MCドロップアウトおよびRealNVPベースのBHNsを上回り、ステップサイズ 0.01 のFGSM攻撃においてAUCスコアが0.98以上を達成した。
  • 異常検出において、BHNsは非ベイジアンモデルやMCドロップアウトを著しく上回り、変動比獲得関数を用いた場合、MNISTではAUC-ROCスコア98.97、CIFARbwでは98.52を記録した。
  • BHNsが得るBALDおよび平均標準偏差の不確実性スコアは、敵対的摂動が加わるに従い強く上昇する傾向を示しており、エピステミック的不確実性推定が信頼できることが示された。これに対して、ドロップアウトはこの行動を捉えられていない。
  • アクティブラーニングおよび正則化タスクにおいても、BHNsは競争力ある性能を示し、複雑で多次元的な事後分布をモデル化できる能力により、不確実性を考慮した予測が可能になった。
  • 計算コストの懸念を克服し、大規模なネットワークに対しても効果的にスケーリング可能であり、MCMC や拒否サンプリングを用いずに、複雑な事後分布からの効率的iidサンプリングを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。