QUICK REVIEW
[論文レビュー] Efficient variational Bayesian neural network ensembles for outlier detection
Nick Pawlowski, Miguel Jaques|arXiv (Cornell University)|Mar 20, 2017
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約
本稿では、訓練中に重みをサンプリングするために確率的勾配ランジュヴィンダイナミクス(SGLD)を用いることで、メモリを最小限に抑えたオンラインの変分事後分布推定を可能にする、効率的な変分ベイジアンニューラルネットワークアンサンブル手法を提案する。この手法は、ドロップアウトMCと同等の異常値検出性能を達成するが、変分近似における重み分散が小さいため、アンサンブルサイズの増大に伴い性能が向上しない。
ABSTRACT
In this work we perform outlier detection using ensembles of neural networks obtained by variational approximation of the posterior in a Bayesian neural network setting. The variational parameters are obtained by sampling from the true posterior by gradient descent. We show our outlier detection results are comparable to those obtained using other efficient ensembling methods.
研究の動機と目的
- 異常値検出に適した、メモリ効率の良いベイジアンニューラルネットワークアンサンブルの構築手法を開発すること。
- すべてのサンプルを保存せずに、訓練中に重みの事後分布をオンラインで推定できること。
- 単一のネットワーク訓練ランで、競争力のある不確実性推定と異常値検出性能を達成すること。
- ドロップアウトMCや標準アンサンブルといった既存のアンサンブル手法と比較して、本手法の性能を評価すること。
- 不確実性の定量化を可能にしつつ、計算およびメモリコストを低く保てるようにすること。
提案手法
- 本手法は、訓練経路に沿って重みのサンプルを生成するために確率的勾配ランジュヴィンダイナミクス(SGLD)を用い、それらを正規化されていない事後分布からの抽出とみなす。
- Welfordのインクリメンタルアルゴリズムを適用して、重みサンプルの平均および分散をリアルタイムで計算し、変分事後分布パラメータのオンライン推定を可能にする。
- 変分近似は、重みの各要素に対して対角ガウス分布を採用し、不偏モンテカルロ推定を用いてパラメータを段階的に更新する。
- テスト段階では、学習済みの変分事後分布から複数のネットワークをサンプリングし、予測と不確実性推定用のアンサンブルを構築する。
- 異常値検出は、各アンサンブルメンバーの予測とアンサンブル平均との間のKLダイバージェンスの和(不一致度)を用い、訓練データの統計量を用いてしきい値を設定する。
- 適応的最適化手法(例:Adam)と互換性がある。適応的学習率に比例したノイズを注入することで、標準的な最適化手法を用いた実用的訓練が可能になる。
実験結果
リサーチクエスチョン
- RQ1訓練中にオンラインで重みをサンプリングすることで、低メモリ・低計算コストのベイジアンニューラルネットワークアンサンブルを構築できるか?
- RQ2本手法の分類精度および異常値検出性能は、ドロップアウトMCおよび標準アンサンブルと比較してどのように異なるか?
- RQ3SGLDサンプルから導出された変分近似は、効果的な異常値検出に十分な不確実性推定を提供するか?
- RQ4本手法は、より多くのネットワークをサンプリングできるにもかかわらず、アンサンブルサイズの増大に伴い性能が向上しないのはなぜか?
- RQ5適応的最適化手法(例:Adam)と効果的に組み合わせられ、サンプリングの有効性を保てるか?
主な発見
- 本手法は、MNISTデータセットにおいて10個のアンサンブル成分で76.1%の分類精度を達成し、ドロップアウトMC(72.9%)を上回るが、標準アンサンブル(87.0%)には及ばない。
- すべての手法において異常値検出の再現率は高いが、本手法およびドロップアウトMCの精度は低く、偽陽性率が高い。
- 本手法の不一致スコアは10^-3から10^-2のオーダーであり、ドロップアウトMC(10^-1から10^0)よりも顕著に低い。これは、重み分散が小さく、変分近似がきわめてタイトであることを示している。
- 変分事後分布が強く集中しているため、アンサンブルサイズの増大に伴い性能が向上しない。予測の多様性が制限されている。
- 異常値検出の精度ではドロップアウトMCにやや劣るが、分類精度では優れているため、不確実性のキャリブレーションと予測性能の間にはトレードオフがあると考えられる。
- Adamに基づくSGLD近似を用いた追加実験でも一貫した結果が得られ、本手法の標準トレーニングパイプラインへの適応可能性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。