Skip to main content
QUICK REVIEW

[論文レビュー] Good Initializations of Variational Bayes for Deep Models

Simone Rossi, Pietro Michiardi|Graduate School and Research Center in Digital Science (EURECOM)|Oct 18, 2018
Gaussian Processes and Bayesian Inference被引用数 10
ひとこと要約

本稿では、深層モデルにおける確率的変分ベイズ推論(SVI)のための階層的初期化戦略として、反復的ベイジアン線形モデリング(i-BLM)を提案する。ベイジアン線形モデルを用いて変分事後分布を初期化することで、ベイジアン深層ニューラルネットワークおよびConvNetsにおける収束速度の向上と安定性の向上を実現し、単純なガウス事後分布を用いてもモンテカルロドロップアウトやノイズ付きKFACと同等の最先端の性能を達成する。

ABSTRACT

Stochastic variational inference is an established way to carry out approximate Bayesian inference for deep models. While there have been effective proposals for good initializations for loss minimization in deep learning, far less attention has been devoted to the issue of initialization of stochastic variational inference. We address this by proposing a novel layer-wise initialization strategy based on Bayesian linear models. The proposed method is extensively validated on regression and classification tasks, including Bayesian DeepNets and ConvNets, showing faster and better convergence compared to alternatives inspired by the literature on initializations for loss minimization.

研究の動機と目的

  • ベイジアンディープラーニングにおける確率的変分ベイズ推論(SVI)のための体系的でない初期化戦略の欠如に取り組む。
  • ベイジアン線形モデルを用いた初期化により、深層モデルにおけるSVIの収束速度と解の品質を向上させる。
  • 畳み込みニューラルネットワーク(CNN)のような複雑なアーキテクチャにおいて、単純なガウス事後分布近似を効果的に使用できるようにする。これは、初期化が不十分な場合に自明な解に収束するのを防ぐ。
  • 回帰および分類タスクの両方において、損失最小化に着想を得た初期化手法と比較して、i-BLMがSVIで優れた性能を示すことを実証的に検証する。
  • SVIにi-BLMを用いることで、画像分類ベンチマークにおいてモンテカルロドロップアウトやノイズ付きKFACといった最先端手法と同等の性能を達成できることを示す。

提案手法

  • i-BLMは、各層の活性化からターゲットラベルへの回帰を実行するベイジアン線形モデルを訓練することで、階層的に初期化を実行する。
  • 各層 l に対して、前の層からの活性化を用いてトレーニングされたベイジアン線形回帰モデルにより、重みに関する事後分布を学習する。
  • ベイジアン線形モデルから得られた事後分布の平均と分散が、SVIにおけるガウス事後分布の変分パラメータ(平均と対数分散)の初期値として使用される。
  • 初期化は最初の隠れ層から最終層まで反復的に適用され、計算コストの増加を最小限に抑えつつ、スケーラブルで効率的な初期化を実現する。
  • 本手法は、フィードフォワードネットワークおよび畳み込みアーキテクチャ(LeNet-5、AlexNet、VGG16を含む)と両立可能である。
  • 過パラメータ化への対処のため、訓練の初期段階でKLダイバージェンス項の重みを段階的に上げるウォームアップを導入し、初期段階における事前分布の優位性を軽減する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン線形モデルに基づく初期化は、深層ニューラルネットワークにおける確率的変分ベイズ推論の収束性と性能を向上させることができるか?
  • RQ2i-BLMは、標準的な初期化が失敗するような、深層ConvNetsにおける因子化ガウス事後分布を用いたSVIの有効な訓練を可能にするか?
  • RQ3損失最小化に着想を得た初期化戦略と比較して、i-BLMは収束速度および最終的な性能において優れているか?
  • RQ4単純なガウス事後分布とi-BLM初期化を組み合わせたSVIは、モンテカルロドロップアウトやノイズ付きKFACといった高度な手法と同等の性能を達成できるか?
  • RQ5事前分布の指定が、深層モデルにおけるSVIの最適化ダイナミクスに与える影響は何か?

主な発見

  • i-BLMを用いることで、損失最小化に着想を得た初期化手法よりも、回帰および分類タスクの両方で顕著に高速な収束が実現される。
  • MNISTおよびCIFAR-10において、VGG16を用いたSVIは、i-BLMによりテスト負の対数尤度(NLL)が0.6443にまで低下し、モンテカルロドロップアウト(0.8213)およびノイズ付きKFAC(0.7327)を上回る性能を示す。
  • CIFAR-10におけるVGG16を用いたi-BLM付きSVIの誤差率は0.1682であり、モンテカルロドロップアウト(0.2147)と同等かやや優れており、ノイズ付きKFAC(0.1506)よりもわずかに優れている。
  • i-BLMを用いることで、初期化が不十分な場合に自明な解(事後分布が事前分布と等しくなる)に収束するのを深層ConvNetsで効果的に回避できる。
  • 本手法により、単純な因子化ガウス事後分布を用いたSVIが、VGG16を用いたCIFAR-10で最先端の性能を達成できることを示しており、これは過パラメータ化されたモデルに対しても有効であることを示している。
  • アブレーションスタディの結果、i-BLMは代替の初期化戦略と比較して、より優れた不確実性のキャリブレーションと信頼性の高い外挿不確実性推定を実現していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。