Skip to main content
QUICK REVIEW

[論文レビュー] Discriminative Jackknife: Quantifying Uncertainty in Deep Learning via Higher-Order Influence Functions

Ahmed M. Alaa, Mihaela van der Schaar|arXiv (Cornell University)|Jun 29, 2020
Anomaly Detection Techniques and Applications被引用数 12
ひとこと要約

本稿では、再訓練を伴わずにleave-one-outモデルの挙動を近似する高次影響関数を活用することで、理論的保証に基づく被覆性と識別性能を満たす、頻度主義的信頼区間を構築するpost-hocでモデルに依存しない手法、Discriminative Jackknife (DJ) を提案する。この手法により、深層学習における正確な不確実性評価が可能になる。

ABSTRACT

Deep learning models achieve high predictive accuracy across a broad spectrum of tasks, but rigorously quantifying their predictive uncertainty remains challenging. Usable estimates of predictive uncertainty should (1) cover the true prediction targets with high probability, and (2) discriminate between high- and low-confidence prediction instances. Existing methods for uncertainty quantification are based predominantly on Bayesian neural networks; these may fall short of (1) and (2) -- i.e., Bayesian credible intervals do not guarantee frequentist coverage, and approximate posterior inference undermines discriminative accuracy. In this paper, we develop the discriminative jackknife (DJ), a frequentist procedure that utilizes influence functions of a model's loss functional to construct a jackknife (or leave-one-out) estimator of predictive confidence intervals. The DJ satisfies (1) and (2), is applicable to a wide range of deep learning models, is easy to implement, and can be applied in a post-hoc fashion without interfering with model training or compromising its accuracy. Experiments demonstrate that DJ performs competitively compared to existing Bayesian and non-Bayesian regression baselines.

研究の動機と目的

  • 被覆性と識別性能の両方を満たす、深層学習モデルにおける厳密な頻度主義的不確実性評価の欠如に対処すること。
  • モデル学習の変更を加えず、予測精度を損なわずに有効な信頼区間を提供する手法を開発すること。
  • ドロップアウトベースのモデルにおける不適切な事後分布や、頻度主義的被覆性の欠如といった、ベイズ的手法の限界を克服すること。
  • 多様な深層学習アーキテクチャに適用可能なpost-hocでの不確実性推定を可能にすること。
  • 不確実性推定が統計的に有効(被覆性)であり、かつ高信頼度・低信頼度の予測を区別する意味を持つ(識別性能)こと。

提案手法

  • 個々の訓練データ点を削除したときのモデル予測への影響を推定するために影響関数を用い、完全な再訓練を回避する。
  • 2次 von Mises 展開を用いて、高次影響関数(HOIFs)を用いてleave-one-outモデルパラメータを近似する。
  • HOIFsは、Koh & Liang (2017) の1次影響関数法を拡張した近似式により計算される。
  • 局所的予測分散と平均LOO誤差残差を組み合わせることで、信頼区間の幅を調整する。
  • 訓練後に行われるため、任意の微分可能な深層学習モデルと互換性があり、モデルに依存しない。
  • 特徴量固有の不確実性に基づいて信頼区間の幅を補正することで、理論的頻度主義的被覆性と識別性能を保証する。

実験結果

リサーチクエスチョン

  • RQ1post-hoc手法は、深層学習における頻度主義的信頼区間を、高い被覆性と強力な識別性能を満たす形で提供できるか?
  • RQ2影響関数を高次に拡張することで、再訓練を伴わずleave-one-outモデル挙動を正確に近似できるか?
  • RQ3被覆性、識別性能、予測精度の観点から、提案手法はベイズ的手法および非ベイズ的手法のベースラインと比較してどのように性能を発揮するか?
  • RQ4信頼性の高い不確実性推定を提供しつつ、予測精度を高く維持できるか?
  • RQ5アーキテクチャの変更なしに、多様な深層学習アーキテクチャおよびデータセットに一般化可能か?

主な発見

  • Discriminative Jackknifeは、4つのUCI回帰データセットすべてで目標の90%被覆率を達成し、PBP や BNN といったベイズベースラインよりも被覆率が低い傾向にあった。
  • DJは4つのデータセットのうち3つで最高のAUPRCスコアを達成し、高信頼度と低信頼度の予測を効果的に識別していることを示した。
  • Kin8nmデータセットでは、95%信頼区間で93.77%の被覆率を達成し、すべての手法の中で最小のMSE(0.00)を維持した。
  • Yachtデータセットでは、MCDPよりAUPRCとMSEの両面で優れており、不確実性の質と予測精度のバランスに優れていることが示された。
  • すべてのデータセットで予測精度が最も高く(MSEが最小)、post-hoc性がモデル性能の低下をもたらさないことを確認した。
  • DJはすべてのテストセットで有効な信頼区間を提供したが、PBPとDEは意味のあるAUPRCスコアを達成できず、ランダムな性能に近い結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。