Skip to main content
QUICK REVIEW

[论文解读] Uncertainty Baselines: Benchmarks for Uncertainty & Robustness in Deep Learning

Zachary Nado, Neil Band|arXiv (Cornell University)|Jun 7, 2021
Adversarial Robustness in Machine Learning被引用 5
一句话总结

该论文介绍了 Uncertainty Baselines,这是一个全面的库,提供了在 9 种不同任务(包括图像、表格和文本基准)中 19 种最先进深度学习方法的高质量、可复现的实现。它通过统一的流水线、模型检查点和排行榜,实现了不确定性与鲁棒性的标准化评估,显著降低了在深度学习中进行基准测试和方法比较的门槛。

ABSTRACT

High-quality estimates of uncertainty and robustness are crucial for numerous real-world applications, especially for deep learning which underlies many deployed ML systems. The ability to compare techniques for improving these estimates is therefore very important for research and practice alike. Yet, competitive comparisons of methods are often lacking due to a range of reasons, including: compute availability for extensive tuning, incorporation of sufficiently many baselines, and concrete documentation for reproducibility. In this paper we introduce Uncertainty Baselines: high-quality implementations of standard and state-of-the-art deep learning methods on a variety of tasks. As of this writing, the collection spans 19 methods across 9 tasks, each with at least 5 metrics. Each baseline is a self-contained experiment pipeline with easily reusable and extendable components. Our goal is to provide immediate starting points for experimentation with new methods or applications. Additionally we provide model checkpoints, experiment outputs as Python notebooks, and leaderboards for comparing results. Code available at https://github.com/google/uncertainty-baselines.

研究动机与目标

  • 解决深度学习模型在不确定性与鲁棒性评估方面缺乏标准化、可复现基线的问题。
  • 通过提供文档齐全、自包含且可扩展的代码实现,降低新方法比较的门槛。
  • 统一多种现实世界和标准基准中的不确定性估计技术,如贝叶斯神经网络、蒙特卡洛丢弃和集成方法。
  • 通过一致的超参数调优、评估指标和共享实验输出,提升可复现性与公平比较。
  • 作为社区驱动的基石,通过支持在不同任务和模态间快速适配和扩展基线,为未来研究提供支持。

提出的方法

  • 该库为每种方法实现了端到端的实验流水线,将数据集加载、模型架构、训练和评估抽象为模块化、可重用的组件。
  • 每个基线均包含基础模型选择(如 Wide ResNet、ResNet-50、BERT)、训练数据集(如 CIFAR、ImageNet、Diabetic Retinopathy)和评估指标(准确率、校准误差、选择性预测、推理延迟)。
  • 采用标准化的训练协议,图像模型使用 Nesterov 动量,文本模型使用 AdamW,同时保持一致的学习率调度和数据预处理方式(如随机裁剪、翻转、归一化)。
  • 通过准随机搜索进行超参数调优,分两轮进行:首轮广泛搜索,第二轮聚焦优化,以验证集 AUC 作为选择指标。
  • 该库支持 TensorFlow 和 PyTorch 后端,使用无状态随机操作进行确定性预处理,以确保可复现性。
  • 所有结果、模型检查点和实验输出均以 Jupyter 笔记本形式发布,并托管在 GitHub 上,确保完全可复现性,并支持社区扩展。

实验结果

研究问题

  • RQ1如何在不同任务和模型之间一致地评估深度学习中的不确定性与鲁棒性?
  • RQ2在图像、表格和文本基准中,现代不确定性估计方法(如 MC-Dropout、SNGP、贝叶斯神经网络)的相对性能如何?
  • RQ3当正确调优时,标准基线在多大程度上优于更复杂的模型?
  • RQ4通过共享文档齐全的代码库,如何提升不确定性研究中的可复现性与公平比较?
  • RQ5一个统一的、社区维护的库能否显著减少基准测试新型不确定性方法所需的工作量?

主要发现

  • Uncertainty Baselines 库在 9 项任务中提供了 83 个不同的基线,涵盖 19 种不确定性估计方法,包括贝叶斯神经网络、蒙特卡洛丢弃、集成方法,以及 SNGP 和 Hyper-BatchEnsemble 等现代方法。
  • 在 Diabetic Retinopathy 基准中,通过准随机搜索进行超参数调优,验证集 AUC 得到提升,最终模型在训练集与验证集合并后重新训练以获得最佳性能。
  • 该库支持每项基线使用 5 项以上指标进行一致评估,包括预测准确率、校准误差、选择性预测和推理延迟。
  • 模型检查点、实验输出和 Jupyter 笔记本均公开可用,确保完全可复现性,并支持新研究的快速适配。
  • 该库将以往孤立的基准(如 Riquelme 等,2018;Hendrycks 与 Dietterich,2019)统一为一个可扩展、经过充分测试且持续维护的代码库。
  • 通过标准化训练协议、数据预处理和评估流程,该库实现了比以往基于临时实现的比较更公平、更可靠的跨方法比较。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。