[论文解读] On the Role of Dataset Quality and Heterogeneity in Model Confidence
本文研究了数据集质量与异质性对机器学习模型置信度的影响,发现标签噪声会导致模型置信度偏低,而小规模训练集则导致模型置信度过高。为解决类别间校准不平衡问题,作者提出了类别级温度缩放(CTS),该方法在CIFAR数据集上显著提升了所有类别(尤其是低频类别)的校准性能,在平均误差和最差情况误差指标上均优于标准方法。
Safety-critical applications require machine learning models that output accurate and calibrated probabilities. While uncalibrated deep networks are known to make over-confident predictions, it is unclear how model confidence is impacted by the variations in the data, such as label noise or class size. In this paper, we investigate the role of the dataset quality by studying the impact of dataset size and the label noise on the model confidence. We theoretically explain and experimentally demonstrate that, surprisingly, label noise in the training data leads to under-confident networks, while reduced dataset size leads to over-confident models. We then study the impact of dataset heterogeneity, where data quality varies across classes, on model confidence. We demonstrate that this leads to heterogenous confidence/accuracy behavior in the test data and is poorly handled by the standard calibration algorithms. To overcome this, we propose an intuitive heterogenous calibration technique and show that the proposed approach leads to improved calibration metrics (both average and worst-case errors) on the CIFAR datasets.
研究动机与目标
- 理解数据集质量(特别是标签噪声和样本量)如何影响深度学习分类器的模型置信度。
- 研究类别间数据异质性(如各类别间数据质量差异)对模型校准的影响,尤其关注数据质量在各类别间不一致的情况。
- 解决全局校准方法(如温度缩放)在处理类别间置信度不平衡方面的局限性。
- 提出并验证一种类别级校准技术,以提升所有类别在公平性与校准性能方面的表现。
- 通过平均误差和最差情况误差指标,证明所提方法在性能上优于标准校准技术。
提出的方法
- 作者提出类别级温度缩放(CTS)方法,通过按预测类别划分的子集验证集,对每个类别独立应用温度缩放。
- 推导了所提CTS方法的理论验证样本复杂度边界,以确保统计可靠性。
- 该方法涉及将验证集按预测类别进行划分,并对每个子集独立应用温度缩放进行校准。
- 采用可靠性图和校准误差指标(包括期望校准误差(ECE)、最大ECE和平均ECE)对方法进行评估。
- 作者将CTS与标准温度缩放(TS)和向量缩放进行比较,证明其在数据不平衡和噪声数据集上的优越性能。
- 通过在CIFAR-100上进行受控噪声和类别样本量不平衡的实证分析,验证了该方法的有效性。
实验结果
研究问题
- RQ1训练数据中的标签噪声如何影响深度神经网络分类器的置信度?
- RQ2训练数据集规模减小如何影响模型置信度与校准性能?
- RQ3数据异质性(如各类别间噪声水平或样本量差异)如何影响各类别的校准性能?
- RQ4类别级校准方法是否能在公平性与校准准确性方面优于全局校准技术(如温度缩放)?
- RQ5不同校准误差指标(如ECE、max-ECE、Avg-ECE)在评估校准方法公平性与鲁棒性方面发挥什么作用?
主要发现
- 训练数据中的标签噪声导致模型置信度偏低,这与在干净数据训练中常见的过度自信现象相反。
- 较小的训练数据集导致模型置信度过高,原因是准确率降低,且当采样率低于60%时,过度自信现象随采样率下降而加剧。
- 标准温度缩放(TS)会放大低频类别的校准误差,同时提升大类别的性能,表明其存在不公平性。
- 类别级温度缩放(CTS)在所有类别中均能统一提升校准性能,显著降低平均误差与最差情况误差。
- 在所有采样率下,CTS在max-ECE指标上均优于TS,表明其在处理类别间置信度不平衡方面具有更优的公平性。
- Avg-ECE指标揭示了CTS与TS之间存在显著性能差距,表明全局ECE可能掩盖类别层面的校准缺陷,从而验证了最差情况指标的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。