Skip to main content
QUICK REVIEW

[論文レビュー] The Peril of Popular Deep Learning Uncertainty Estimation Methods

Yehao Liu, Matteo Pagliardini|arXiv (Cornell University)|Dec 9, 2021
Gaussian Processes and Bayesian Inference被引用数 11
ひとこと要約

この論文は、一般的に用いられる深層学習の不確実性推定手法における深刻な欠陥を明らかにしている:モンテカルロドロップアウト(MCDropout)とベイジアンニューラルネットワーク(BNNs)は、分布外(OOD)のサンプルに対して期待される挙動とは逆に、低不確実性を割り当てる傾向がある。これに対して、ガウス過程(GPs)はそのようなサンプルを高不確実性で正しく特定する。本研究では、2次元のトイデータとMNISTやCIFAR-10といった実世界のデータセットを用いて、MCDropoutとBNNsがOOD入力を検出できないことを実証的に示しており、GPsはカーネルに基づく距離認識のおかげで成功している。

ABSTRACT

Uncertainty estimation (UE) techniques -- such as the Gaussian process (GP), Bayesian neural networks (BNN), Monte Carlo dropout (MCDropout) -- aim to improve the interpretability of machine learning models by assigning an estimated uncertainty value to each of their prediction outputs. However, since too high uncertainty estimates can have fatal consequences in practice, this paper analyzes the above techniques. Firstly, we show that GP methods always yield high uncertainty estimates on out of distribution (OOD) data. Secondly, we show on a 2D toy example that both BNNs and MCDropout do not give high uncertainty estimates on OOD samples. Finally, we show empirically that this pitfall of BNNs and MCDropout holds on real world datasets as well. Our insights (i) raise awareness for the more cautious use of currently popular UE methods in Deep Learning, (ii) encourage the development of UE methods that approximate GP-based methods -- instead of BNNs and MCDropout, and (iii) our empirical setups can be used for verifying the OOD performances of any other UE method. The source code is available at https://github.com/epfml/uncertainity-estimation.

研究の動機と目的

  • 広く使われている不確実性推定(UE)手法、MCDropoutとBNNsが分布外(OOD)サンプルを検出する能力の信頼性を調査すること。
  • その性能を、分布外検出に優れたゴールドスタンダードとされるガウス過程(GPs)と比較すること。
  • 実世界のシナリオにおいて、MCDropoutとBNNsがOOD入力に対して高不確実性を割り当てないことを実証的に示すこと。
  • GPsのカーネルに基づく類似性モデリングのおかげで、GPsベースの手法がOOD検出においてより頑健である理由を、解析的および実証的に裏付けること。

提案手法

  • 研究では、2次元のトイデータセットを用いて、GP、MCDropout、BNNsの不確実性推定値を、分布内と分布外の領域で視覚的・定量的に比較する。
  • 実世界の評価では、CIFAR-10でResNet-18を訓練し、訓練中に使用されなかったCIFAR-100のサンプルをOODデータとして用い、出力エントロピーを用いて不確実性を測定する。
  • BNNsは、平均場変分推論(MFVI)とハミルトニアンモンテカルロ(HMC)の両方を用いて訓練し、推論手法の不確実性推定への影響を評価する。
  • GPモデルは分類にラプラス近似を用い、関数値の事後分布の分散から予測不確実性を導出する。
  • 不確実性は、予測クラス分布のエントロピーを用いて定量化する:$\mathcal{H}({\bm{x}},{\bm{\omega}}) = -\sum_{c\in C}\hat{{\bm{y}}}_{c}\log\hat{{\bm{y}}}_{c}$。
  • 理論的分析により、テスト点と訓練点間のカーネルベクトル$\mathbf{k}_{\star}$が小さい(つまり、テスト点が訓練データから遠い)場合、GPの不確実性は最大に近づく(2値分類ではエントロピー ≈ 1)、OOD入力に対して高不確実性が保証される。

実験結果

リサーチクエスチョン

  • RQ1MCDropoutとBNNsは、安全な展開が求められる状況で、分布外(OOD)サンプルに対して信頼性を持って高不確実性を割り当てることができるか?
  • RQ2なぜMCDropoutとBNNsはOOD入力を検出できないが、ガウス過程(GPs)は成功するのか?
  • RQ3MCDropoutとBNNsの失敗は、理論的限界であるのか、特定のアーキテクチャや訓練手順に起因するアーティファクトなのか?
  • RQ4GPsのカーネルベースの距離認識が、その優れたOOD検出性能と正式に結びつけられるか?
  • RQ5MNISTやCIFAR-10といった実世界のデータセットにおいて、MCDropoutとBNNsの不確実性推定値はGPsとどのように比較されるか?

主な発見

  • 2次元のトイデータセットにおいて、MCDropoutとBNNsはOODサンプルに対して低不確実性を割り当てている一方、ガウス過程(GPs)は高不確実性を割り当てており、正しく分布外であることを特定している。
  • MNISTでは、0と1の数字で学習し、2〜9の数字をテストしたところ、MCDropoutとBNNsは2〜9の数字に対して平均的に低不確実性を割り当てており、OOD検出が不十分であることが示された。
  • CIFAR-10では、ResNet-18をCIFAR-10で学習し、訓練セットに含まれないCIFAR-100のサンプルをテストデータとして用いたところ、MCDropoutとBNNsは再び低不確実性を割り当て、OOD入力を検出できなかった。
  • 理論的分析により、GPsがOODポイントに対して高不確実性を割り当てる理由が確認された。カーネルベクトル$\mathbf{k}_{\star}$が小さくなると、予測分散が$k(\mathbf{x}_{\star},\mathbf{x}_{\star})$に近づき、エントロピーが1に近づく。
  • MCDropoutとBNNsの失敗は、訓練やハイパーパrameterの問題ではなく、HMC推論を用いたBNNsや、MCDropoutにおける多数のMCサンプルを用いても問題が継続することから、根本的な欠陥であることが示された。
  • 結果から、現在のUE手法は、BNNsやドロップアウトによる重み空間の不確実性に依存するのではなく、カーネルを用いて入力類似性を明示的にモデリングするGPsに類似したアプローチに置き換えるべきであると示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。