Skip to main content
QUICK REVIEW

[论文解读] URSABench: Comprehensive Benchmarking of Approximate Bayesian Inference Methods for Deep Neural Networks

Meet P. Vadera, Adam D. Cobb|arXiv (Cornell University)|Jul 8, 2020
Gaussian Processes and Bayesian Inference被引用 6
一句话总结

URSABench 是一个用于评估深度神经网络中近似贝叶斯推断方法的开源基准测试框架,重点关注不确定性量化、鲁棒性、可扩展性和准确性。它在 CIFAR-10、CIFAR-100 和 OOD 数据集上评估了 SGLD、SGHMC、SWAG 和 MC dropout 等方法,结果表明 cSGLD 和 cSGHMC 在保持最小精度损失的前提下,实现了更优的不确定性校准和鲁棒性,而 SWAG 和 MC dropout 在校准性和决策成本之间存在权衡。

ABSTRACT

While deep learning methods continue to improve in predictive accuracy on a wide range of application domains, significant issues remain with other aspects of their performance including their ability to quantify uncertainty and their robustness. Recent advances in approximate Bayesian inference hold significant promise for addressing these concerns, but the computational scalability of these methods can be problematic when applied to large-scale models. In this paper, we describe initial work on the development ofURSABench(the Uncertainty, Robustness, Scalability, and Accu-racy Benchmark), an open-source suite of bench-marking tools for comprehensive assessment of approximate Bayesian inference methods with a focus on deep learning-based classification tasks

研究动机与目标

  • 为深度学习中近似贝叶斯推断方法缺乏全面、标准化的评估提供解决方案。
  • 开发一个统一的基准测试框架,用于在不确定性量化、鲁棒性、可扩展性和预测准确性方面评估各类方法。
  • 实现在标准深度学习基准上对贝叶斯深度学习方法进行公平且可复现的比较。
  • 支持研究社区识别出在不确定性与鲁棒性至关重要的实际部署场景中最有效的方法。

提出的方法

  • URSABench 实现了一个基于 PyTorch 的开源框架,用于在深度神经网络分类任务中基准测试贝叶斯推断方法。
  • 它包含标准化的数据集(如 CIFAR-10、CIFAR-100、SVHN、STL-10)和模型架构(例如 WideResNet28x10),以确保评估的一致性。
  • 该框架评估了多种近似贝叶斯推断方法:SGLD、SGHMC、cSGLD、cSGHMC、SWAG、MC dropout 以及 PCA + ESS(SI)用于后验近似。
  • 它应用了一套评估指标:准确率(↑)、负对数似然(↓)、期望校准误差(ECE)(↓)、贝叶斯惊讶度(BS)(↓)、决策成本(↓),以及用于 OOD 和误分类检测的 AUROC 和 AUCPR。
  • 基准测试使用蒙特卡洛采样和代理后验近似方法来估计后验预测分布和不确定性量化。
  • 结果在多个指标和数据集上报告,以评估不确定性校准、鲁棒性与计算效率之间的权衡。

实验结果

研究问题

  • RQ1在标准基准上,哪些近似贝叶斯推断方法在深度神经网络中提供了最准确的不确定性估计?
  • RQ2不同贝叶斯方法在检测分布外(OOD)输入和误分类样本方面的能力如何比较?
  • RQ3在贝叶斯深度学习方法中,预测准确性、不确定性校准与计算成本之间的权衡如何?
  • RQ4cSGLD 和 cSGHMC 与标准基线方法(如 MC dropout 和 SWAG)相比,在鲁棒性和决策可靠性方面表现如何?
  • RQ5代理后验方法(如 SWAG)或基于采样的方法(如 SGLD)在保持不确定性质量的前提下,能多大程度地扩展到大模型?

主要发现

  • 在 CIFAR-10 上,cSGLD 实现了最佳的准确率(96.7%)与不确定性校准(ECE: 0.006)平衡,决策成本仅为 102.9,优于 SGHMC 和 MC dropout。
  • 在 CIFAR-100 上,cSGLD 实现了 83.2% 的准确率,ECE 为 0.033,决策成本为 179.3,显著优于 SWAG(准确率 71.0%,ECE 0.110)和 MC dropout。
  • cSGLD 在 OOD 检测方面表现强劲,SVHN 上的 AUROC-Model uncertainty 达到 0.968,STL-10 上为 0.846,优于 SWAG 和 MC dropout。
  • SGHMC 和 SGLD 在误分类检测方面表现良好(AUCPR-Model: 0.439 和 0.435),但 cSGHMC 因更高的不确定性校准偏差而表现较差。
  • SWAG 在不确定性校准方面表现较差(CIFAR-100 上 ECE: 0.110),且决策成本较高(316.9),表明其在安全关键应用中可靠性有限。
  • MC dropout 在不确定性估计方面表现具有竞争力,但其决策成本较高(CIFAR-10 上为 149.0),且 OOD 检测能力弱于 cSGLD。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。