Skip to main content
QUICK REVIEW

[论文解读] Machine Learning State-of-the-Art with Uncertainties

Peter Steinbach, Felicita Gernhardt|arXiv (Cornell University)|Apr 11, 2022
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

本文主张在机器学习研究中报告不确定性区间——特别是准确率度量的置信区间——以提升模型评估的透明度、可复现性和严谨性。通过在图像分类实验中采用交叉验证和自助法,作者表明,当考虑不确定性时,不同模型之间报告的性能差异在统计上可能并不显著,从而挑战了那些忽视这一关键方面的最先进论文的结论。

ABSTRACT

With the availability of data, hardware, software ecosystem and relevant skill sets, the machine learning community is undergoing a rapid development with new architectures and approaches appearing at high frequency every year. In this article, we conduct an exemplary image classification study in order to demonstrate how confidence intervals around accuracy measurements can greatly enhance the communication of research results as well as impact the reviewing process. In addition, we explore the hallmarks and limitations of this approximation. We discuss the relevance of this approach reflecting on a spotlight publication of ICLR22. A reproducible workflow is made available as an open-source adjoint to this publication. Based on our discussion, we make suggestions for improving the authoring and reviewing process of machine learning articles.

研究动机与目标

  • 为解决报告机器学习模型性能时缺乏统计严谨性的问题,特别是基准结果中缺乏不确定性量化。
  • 展示如何通过准确率度量的置信区间揭示模型之间性能差异是否具有统计意义。
  • 倡导将不确定性估计整合为标准机器学习评估与同行评审工作流中的核心组成部分。
  • 通过推广开源、自动化的不确定性感知模型评估工作流,提升可复现性和透明度。
  • 鼓励期刊和会议将不确定性报告作为投稿标准或强制要求。

提出的方法

  • 作者在基于ImageNet-1k的ImageNette数据集上使用20折分层交叉验证,计算多个随机种子下的保留集准确率。
  • 采用正态近似法,利用公式 $ \hat{\sigma} = z \sqrt{ \frac{1}{n_{\text{holdout}}} \cdot \text{ACC}_{\text{holdout}} \cdot (1 - \text{ACC}_{\text{holdout}}) } $ 计算点估计准确率的一倍和两倍标准差置信区间。
  • 该方法应用于三种架构——ResNet、ResNeXt和Vision Transformer——在多个随机种子下评估性能的方差。
  • 作者使用Snakemake构建了完全可复现、带版本控制的工作流,将数据、代码和结果相连接。
  • 通过对比包含与不包含不确定性区间的分析结果,利用可视化手段突出显示重叠的置信区间,从而质疑性能提升显著性的主张。
  • 研究借鉴了McNemar检验等现有统计工具进行正式假设检验,但将不确定性近似视为迈向此类严谨性的实用、临时步骤。

实验结果

研究问题

  • RQ1在适当地考虑不确定性区间时,最先进模型之间报告的性能差异在多大程度上仍具有统计显著性?
  • RQ2在典型的机器学习评估设置中,如何使用标准统计方法近似模型准确率的不确定性?
  • RQ3不确定性报告对同行评审机器学习研究中模型比较的可信度和解释力有何影响?
  • RQ4不确定性估计能否在不带来过高计算成本的前提下,集成到标准的机器学习评估流程中?
  • RQ5为何不确定性估计在机器学习论文中常被忽视?如何改进评审流程以优先关注此类问题?

主要发现

  • ResNe(X)T模型的置信区间非常狭窄且相互重叠,因此报告的性能差异无法被视为具有统计显著性,尽管其被如此呈现。
  • Vision Transformer模型的准确率较低,其置信区间与表现最佳的ResNe(X)T模型不重叠,表明性能差距更为可靠。
  • 在对ICLR 2022一篇重点论文的重新分析中,作者发现所有带有MSA(多头自注意力)模块的模型的95%置信区间均与无MSA的基线模型重叠,从而削弱了其宣称的显著改进。
  • ICLR 2022投稿中评审者对不确定性缺陷缺乏反馈,表明当前的同行评审流程往往无法识别或处理模型比较中的统计过度自信问题。
  • 该研究证实,在标准交叉验证设置下,二项分布准确率的正态近似是有效的,使其成为一种可靠且易于获取的不确定性估计工具。
  • 作者证明,借助Snakemake和公共代码仓库等现代软件栈,不确定性感知评估在当前技术条件下是可行的,且可实现版本控制和可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。