[论文解读] Classifier Calibration: A survey on how to assess and improve predicted class probabilities
本综述全面且及时地概述了二分类与多分类设置下的分类器校准,涵盖评估指标、可视化技术以及后处理校准方法(如等倾度校准、Platt缩放和基于神经网络的校准层)。它强调了恰当评分规则、统一的评估框架,并介绍了PyCalib——一个用于校准评估与模型优化的开源Python库,重点在于提升关键应用中的预测不确定性量化。
This paper provides both an introduction to and a detailed overview of the principles and practice of classifier calibration. A well-calibrated classifier correctly quantifies the level of uncertainty or confidence associated with its instance-wise predictions. This is essential for critical applications, optimal decision making, cost-sensitive classification, and for some types of context change. Calibration research has a rich history which predates the birth of machine learning as an academic field by decades. However, a recent increase in the interest on calibration has led to new methods and the extension from binary to the multiclass setting. The space of options and issues to consider is large, and navigating it requires the right set of concepts and tools. We provide both introductory material and up-to-date technical details of the main concepts and methods, including proper scoring rules and other evaluation metrics, visualisation approaches, a comprehensive account of post-hoc calibration methods for binary and multiclass classification, and several advanced topics.
研究动机与目标
- 为研究人员和实践者提供一个统一、易懂且技术详尽的分类器校准概述。
- 澄清校准中的概念模糊之处,特别是多分类设置下的问题,包括置信度校准与完整类别校准之间的区别。
- 展示并比较已建立的和近期的校准方法,包括等倾度法、Platt法、分箱法、Beta校准以及基于神经网络的校准方法。
- 开发并发布PyCalib,一个开源Python库,实现校准指标、可视化和校准流程。
- 识别校准中的开放问题,如最优分箱选择、对分布外输入的鲁棒性,以及对二阶不确定性的建模。
提出的方法
- 本文综述了经典与现代的校准技术,强调恰当评分规则作为评估与训练目标。
- 引入基于类别的和基于置信度的期望校准误差(ECE)作为量化校准偏差的关键指标。
- 使用可靠性图作为可视化工具,用于诊断预测概率分箱中的校准偏差模式。
- 系统性地回顾并比较了如等倾度回归、Platt缩放和基于分箱的方法等后处理校准方法。
- 提出神经网络校准层作为多分类校准的端到端解决方案,将Platt缩放扩展至K类问题。
- 作者提出一个流程:使用ECE和可靠性图评估校准性,检测校准偏差,并应用后处理校准器以提升性能。
实验结果
研究问题
- RQ1如何在二分类与多分类设置下一致地定义和评估分类器校准?
- RQ2置信度校准与完整类别校准之间的关键区别是什么,为何这种区分至关重要?
- RQ3在不同校准偏差模式下,哪些后处理校准方法表现最佳,应如何选择?
- RQ4如何通过恰当评分规则或专用损失函数在训练过程中改进校准?
- RQ5面对分布偏移或分布外输入时,后处理校准方法存在哪些局限性?
主要发现
- 如对数损失等恰当评分规则在训练和评估校准模型时均有效,因其能促进获得良好校准的概率估计。
- 后处理校准方法(如等倾度回归和Platt缩放)可显著降低期望校准误差(ECE),尤其在对已充分训练的模型应用时效果更明显。
- 多分类校准比二分类更复杂,若将其分解为一对多任务可能导致归一化概率未校准,因此需要原生的多分类方法。
- PyCalib库提供了一个统一的框架,用于校准评估、可视化与应用,支持广泛的校准技术与指标。
- 目前尚无标准方法用于选择ECE计算中的分箱策略或分箱数量,交叉验证可能有助于调优这些超参数。
- 当前的后处理校准方法无法提升对分布外输入的鲁棒性,凸显了不确定性估计中的一个关键开放挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。