Skip to main content
QUICK REVIEW

[論文レビュー] Empirical Frequentist Coverage of Deep Learning Uncertainty Quantification Procedures

Benjamin Kompa|arXiv (Cornell University)|Nov 30, 2021
Adversarial Robustness in Machine Learning参考文献 30被引用数 25
ひとこと要約

本論文は、データセットシフトを伴う・伴わない回帰および分類タスクにおいて、ベイジアンニューラルネットワーク、モンテカルロドロップアウト、アンサンブルなどの深層学習の不確実性評価手法の経験的頻度的カバレッジを評価する。一部の手法は分布内データでは良好なカバレッジを達成しているが、分布シフト下ではカバレッジが著しく低下することが判明し、実世界への展開における重要な制限を浮き彫りにしている。

ABSTRACT

Uncertainty quantification for complex deep learning models is increasingly important as these techniques see growing use in high-stakes, real-world settings. Currently, the quality of a model’s uncertainty is evaluated using point-prediction metrics, such as the negative log-likelihood (NLL), expected calibration error (ECE) or the Brier score on held-out data. Marginal coverage of prediction intervals or sets, a well-known concept in the statistical literature, is an intuitive alternative to these metrics but has yet to be systematically studied for many popular uncertainty quantification techniques for deep learning models. With marginal coverage and the complementary notion of the width of a prediction interval, downstream users of deployed machine learning models can better understand uncertainty quantification both on a global dataset level and on a per-sample basis. In this study, we provide the first large-scale evaluation of the empirical frequentist coverage properties of well-known uncertainty quantification techniques on a suite of regression and classification tasks. We find that, in general, some methods do achieve desirable coverage properties on in distribution samples, but that coverage is not maintained on out-of-distribution data. Our results demonstrate the failings of current uncertainty quantification techniques as dataset shift increases and reinforce coverage as an important metric in developing models for real-world applications.

研究の動機と目的

  • 深層学習における一般的な不確実性評価手法の経験的頻度的カバレッジを評価すること。
  • 回帰および分類タスクにおける分布シフト下でのカバレッジ特性の変化を調査すること。
  • カバレッジと幅を指標として用いる際の解釈可能性と実用性を、実世界の展開に鑑みて評価すること。
  • 多様なベンチマークにおいて、カバレッジ、幅、ブライアスコア、ECEを用いて不確実性手法を比較すること。
  • 臨床医などの非技術的ユーザーにとって、従来のキャリブレーションスコアよりも直感的で信頼性が高い指標としてカバレッジが有効であることを示すこと。

提案手法

  • マージナルカバレッジを指標として用いる:予測された95%予測区間または予測集合に真のラベルが含まれる割合。
  • 分布内テストセットと分布外の破損(CIFAR-10-C、ImageNet-C)の両方でカバレッジを測定し、データセットシフト下でのロバストネスを評価。
  • 標準的な不確実性評価手法を用いる:ディープアンサンブル、モンテカルロドロップアウト、確率的変分推論(SVI)、ガウス過程、温度スケーリング。
  • 訓練セットの標準偏差(回帰)または平均集合サイズ(分類)を用いて予測区間幅を計算し、キャリブレーション効率を評価。
  • 実世界の実務者ワークフローを反映するため、ネストドクロスバリデーションを用いてハイパーパrameterを最適化。
  • カバレッジ、幅、ブライアスコア、期待キャリブレーション誤差(ECE)を用いて、指標間の一貫性を評価する。

実験結果

リサーチクエスチョン

  • RQ1一般的な不確実性評価手法は、データセットシフト下でも95%のマージナルカバレッジを維持できるか?
  • RQ2予測区間幅は、データセットシフトおよびカバレッジ性能とどのように相関するか?
  • RQ3カバレッジ順位は、ECE やブライアスコアといった従来の指標順位とどのように一致するか?
  • RQ4どの不確実性手法が多様なベンチマークおよびシフトレベルにおいて最もロバストなカバレッジを提供するか?
  • RQ5予測幅は、実世界の応用においてデータセットシフトを検出するためのソフトなプロキシとして機能できるか?

主な発見

  • アンサンブル、温度スケーリング、ドロップアウト手法は、SVI やガウス過程と比較して、ImageNet-C や CIFAR-10-C の破損データに対してより高いカバレッジを維持した。
  • 分布シフト下でも予測区間幅が拡大してもカバレッジが著しく低下し、不十分なロバストネスが示された。
  • SVI および LL-SVI は、特に回帰タスクにおいて、最小の幅で最高のカバレッジを達成した。
  • 予測集合の幅は、MNIST においてトランスレーションシフトの大きさと0.9のピアソン相関を示し、分布シフトのプロキシとしての有効性を示唆した。
  • カバレッジ順位は、ECE やブライアスコアの順位と非常に一貫していたが、非技術的ユーザーにとってカバレッジはより解釈しやすいとされた。
  • 幅を増大させても、分布外データでは95%のカバレッジを維持できる手法は存在せず、その増大量はカバレッジ水準の維持に不十分であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。