[論文レビュー] Fast Adaptive Weight Noise
本稿では、サンプリングを用いず、分散伝播を活用して周辺尤度および予測分布を近似することで、順伝播型ニューラルネットワークにおける変分ベイズ推論のための計算的に効率的な手法、Fast Adaptive Weight Noise (FAWN) を提案する。本手法は、小規模および大規模データセットにおいて、ガウス過程や確率的バックプロパゲーションを含む先行手法を上回る競争力のある回帰性能を達成する。
Marginalising out uncertain quantities within the internal representations or parameters of neural networks is of central importance for a wide range of learning techniques, such as empirical, variational or full Bayesian methods. We set out to generalise fast dropout (Wang & Manning, 2013) to cover a wider variety of noise processes in neural networks. This leads to an efficient calculation of the marginal likelihood and predictive distribution which evades sampling and the consequential increase in training time due to highly variant gradient estimates. This allows us to approximate variational Bayes for the parameters of feed-forward neural networks. Inspired by the minimum description length principle, we also propose and experimentally verify the direct optimisation of the regularised predictive distribution. The methods yield results competitive with previous neural network based approaches and Gaussian processes on a wide range of regression tasks.
研究の動機と目的
- 従来の手法(ガウス過程やランダムフォレストなど)が好まれる小規模データの回帰タスクにベイジアンニューラルネットワークを適用する課題に対処すること。
- 深層ネットワークにおけるサンプリングベースのベイジアン推論の計算負荷を軽減し、周辺尤度および予測分布の決定的近似を可能にすること。
- 最小記述長原理にインspiredされた新たな正則化付き変分推論手法(FAWN-ROPD)を考案し、予測分布を直接最適化すること。
- 高速ドロップアウトを一般化し、一般のノイズ過程および相関のある出力ユニットを扱えるようにし、不確実性推定の効率性と正確性を向上させること。
提案手法
- 重みの不確実性下でのネットワーク出力の平均および分散を分散伝播を用いて計算し、トレーニング中に確率的サンプリングを回避する。
- 高速ドロップアウトを一般化し、重みに任意のノイズ分布(正規分布およびベルヌーイ分布)を扱えるようにし、パラメータの効率的マージン化を可能にする。
- 最小記述長原理にインspiredされた新たな正則化目的関数(FAWN-ROPD)を導入し、負の対数尤度に正則化項を加算することで最適化する。
- 重み分布を対角正規分布またはベルヌーイ分布でモデル化し、分散伝播のルールに従ってバックプロパゲーションによりパラメータを最適化する。
- ReLU活性化関数を用いた順伝播型ニューラルネットワークに本手法を適用し、128サンプルのミニバッチ勾配推定を用いてAdam最適化を実行する。
- 出力ユニット間の相関を考慮するため、分散伝播を多出力設定に拡張し、共同不確実性モデリングを可能にするCo-FAWNを実装する。
実験結果
リサーチクエスチョン
- RQ1分散伝播を用いて、サンプリングを伴わず、ベイジアンニューラルネットワークにおける周辺尤度および予測分布を効率的に近似できるか?
- RQ2提案手法 FAWN-ROPD は、小規模データの回帰タスクにおいて、標準的な変分推論および他のベイジアンディープラーニング手法と比較して、予測性能で優れているか?
- RQ3FAWN はベルヌーイドロップアウトを越えて、他のノイズ過程および相関のある出力ユニットへ一般化できる程度の汎用性を持つか?
- RQ4最小記述長原理に基づく正則化された予測分布の直接最適化は、標準的な変分推論よりも一般化性能が優れているか?
- RQ5さまざまなデータサイズを有する多様な回帰ベンチマークにおいて、FAWN はガウス過程や他の最先端手法と比較して、どのように性能を発揮するか?
主な発見
- ボストン、コンクリート、ヨートの各データセットにおいて、FAWN-ROPD は全手法の中で最高の性能を示し、負の対数尤度はそれぞれ 2.559 ± 0.161、3.107 ± 0.134、0.336 ± 0.271 を記録した。
- ナヴァルデータセットでは、FAWN-ROPD が負の対数尤度 -6.837 ± 0.131 を達成し、ガウス過程や確率的バックプロパゲーションを含む全手法を上回った。
- Kin8nm データセットでは、FAWN-ROPD が負の対数尤度 -1.211 ± 0.032 を達成し、FAWN-VI(-1.006 ± 0.027)および PBP(-0.964 ± 0.007)を著しく上回った。
- 多出力回帰を伴うジュラデータセットでは、Co-FAWN が FAWN-ROPD の 11.1407 ± N/A から 8.6396 ± N/A へ負の対数尤度を低下させ、相関のある出力における性能向上を示した。
- 大規模なYearデータセット(515,345サンプル)では、FAWN-ROPD が負の対数尤度 3.472 ± N/A を達成し、FAWN-VI(3.807 ± N/A)を上回り、大規模データセットへのスケーラビリティを示した。
- ロボット工学、計算生物学、予測保守を含む、すべてのテストされた回帰タスクで、別個の検証セットや広範なハイパーパramータチューニングを必要とせずに、競争力ある結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。