Skip to main content
QUICK REVIEW

[论文解读] Discriminative Jackknife: Quantifying Uncertainty in Deep Learning via Higher-Order Influence Functions

Ahmed M. Alaa, Mihaela van der Schaar|arXiv (Cornell University)|Jun 29, 2020
Anomaly Detection Techniques and Applications被引用 12
一句话总结

本文提出了判别性自助法(Discriminative Jackknife, DJ),一种后处理、模型无关的深度学习方法,用于构建满足覆盖性和判别性的频率学置信区间。通过利用高阶影响函数,在无需重新训练的情况下近似删除单个训练样本后的模型行为,DJ 实现了具有覆盖性和判别性能理论保证的精确不确定性量化。

ABSTRACT

Deep learning models achieve high predictive accuracy across a broad spectrum of tasks, but rigorously quantifying their predictive uncertainty remains challenging. Usable estimates of predictive uncertainty should (1) cover the true prediction targets with high probability, and (2) discriminate between high- and low-confidence prediction instances. Existing methods for uncertainty quantification are based predominantly on Bayesian neural networks; these may fall short of (1) and (2) -- i.e., Bayesian credible intervals do not guarantee frequentist coverage, and approximate posterior inference undermines discriminative accuracy. In this paper, we develop the discriminative jackknife (DJ), a frequentist procedure that utilizes influence functions of a model's loss functional to construct a jackknife (or leave-one-out) estimator of predictive confidence intervals. The DJ satisfies (1) and (2), is applicable to a wide range of deep learning models, is easy to implement, and can be applied in a post-hoc fashion without interfering with model training or compromising its accuracy. Experiments demonstrate that DJ performs competitively compared to existing Bayesian and non-Bayesian regression baselines.

研究动机与目标

  • 解决深度学习模型中缺乏同时满足覆盖性和判别性的严格频率学不确定性量化问题。
  • 开发一种方法,在不修改模型训练过程且不损害预测准确率的前提下,提供有效的置信区间。
  • 克服贝叶斯方法的局限性,例如在基于丢弃的模型中存在覆盖性差和后验分布定义不当的问题。
  • 实现在多种深度学习架构中均可适用的后处理不确定性估计。
  • 确保不确定性估计在统计上有效(覆盖性)且在识别高置信与低置信预测方面具有实际意义(判别性)。

提出的方法

  • 该方法使用影响函数来估计删除单个训练样本对模型预测的影响,避免完整重新训练。
  • 采用二阶 von Mises 展开,利用高阶影响函数(HOIFs)近似删除单个样本后的模型参数。
  • HOIFs 通过一种近似公式计算,该公式扩展了 Koh 与 Liang(2017)提出的一阶影响函数方法。
  • 通过结合局部预测方差与平均 LOO 误差残差来调整区间宽度,构建置信区间。
  • 该过程在训练后应用,使其与任何可微分的深度学习模型兼容,具有模型无关性。
  • 通过基于特征特定不确定性的区间宽度校准,确保理论上的频率学覆盖性和判别性表现。

实验结果

研究问题

  • RQ1后处理方法能否在深度学习中提供同时实现高覆盖性和强判别的频率学置信区间?
  • RQ2影响函数能否被推广至高阶,以在不重新训练的情况下准确近似删除单个样本后的模型行为?
  • RQ3与贝叶斯和非贝叶斯基线方法相比,所提出方法在覆盖性、判别性和预测准确率方面的表现如何?
  • RQ4该方法是否在提供可靠不确定性估计的同时保持了高预测准确率?
  • RQ5该方法能否在不修改网络架构的前提下,推广至多样化的深度学习架构和数据集?

主要发现

  • 判别性自助法在全部四个 UCI 回归数据集上均实现了目标 90% 的覆盖率,优于贝叶斯基线方法(如 PBP 和 BNN),后者表现出覆盖不足。
  • 在四个数据集中的三个上,DJ 取得了最高的 AUPRC 分数,表明其在高置信与低置信预测之间具有优异的判别能力。
  • 在 Kin8nm 数据集上,DJ 实现了 93.77% 的覆盖率(95% 置信区间),同时在所有方法中保持最低的 MSE(0.00)。
  • 在 Yacht 数据集上,DJ 在 AUPRC 和 MSE 上均优于 MCDP,表明其在不确定性质量与预测准确率之间具有更优的权衡。
  • 该方法在所有数据集上均保持了最高的预测准确率(最低 MSE),证实其后处理特性未降低模型性能。
  • DJ 在所有测试集上均提供了有效的置信区间,而 PBP 和 DE 未能获得有意义的 AUPRC 分数,表明其表现接近随机水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。