[论文解读] On the Calibration of Multiclass Classification with Rejection
本文研究了带拒绝的多分类问题,为两种方法提供了校准保证:一种是基于置信度、使用平滑损失函数(如交叉熵)的方法,另一种是分类器-拒绝器训练方法。研究发现,尽管分类器-拒绝器方法在多分类设置中由于条件过于严格而无法实现校准,但基于置信度、使用平滑损失的方法可实现贝叶斯最优校准,且在基准数据集上的实证结果验证了该结论。
We investigate the problem of multiclass classification with rejection, where a classifier can choose not to make a prediction to avoid critical misclassification. First, we consider an approach based on simultaneous training of a classifier and a rejector, which achieves the state-of-the-art performance in the binary case. We analyze this approach for the multiclass case and derive a general condition for calibration to the Bayes-optimal solution, which suggests that calibration is hard to achieve by general loss functions unlike the binary case. Next, we consider another traditional approach based on confidence scores, in which the existing work focuses on a specific class of losses. We propose rejection criteria for more general losses for this approach and guarantee calibration to the Bayes-optimal solution. Finally, we conduct experiments to validate the relevance of our theoretical findings.
研究动机与目标
- 理解多分类带拒绝问题的理论局限性,特别是关于校准的问题。
- 分析分类器-拒绝器训练方法在多分类问题中实现校准的可行性。
- 将校准保证从二分类扩展到使用置信度分数和平滑损失函数的多分类带拒绝问题。
- 通过在标准多分类数据集上的实证实验验证理论发现。
提出的方法
- 为多分类问题中的分类器-拒绝器方法提出了一般性的校准条件,表明该条件在二分类以外的情形下难以满足。
- 基于平滑损失函数(如逻辑回归、平方损失、指数损失、交叉熵)导出的置信度分数,引入了拒绝准则。
- 证明了对于一大类平滑损失函数,基于置信度的方法在多分类设置中可实现对贝叶斯最优解的校准。
- 推导了确保基于置信度方法在无限样本下一致(即校准)的逐点风险最小化条件。
- 在 letter、vehicle、satimage、yeast 和 covtype 等数据集上,对多种方法(APC、MPC、OVA、CE)在不同拒绝成本下进行了实证评估。
- 使用拒绝率和准确率的均值与标准差,在10次试验中验证了理论预测的可靠性。
实验结果
研究问题
- RQ1分类器-拒绝器方法能否在多分类分类中实现校准?需要满足什么条件?
- RQ2为何在多分类情况下,分类器-拒绝器方法的校准比在二分类情况下更困难?
- RQ3基于置信度的拒绝方法是否能通过平滑损失函数在多分类分类中保证校准?
- RQ4在不同拒绝成本下,不同损失函数(逻辑回归、指数、交叉熵)在实际中表现如何?
- RQ5基于置信度方法的理论校准保证是否在多种多分类数据集上均得到实证验证?
主要发现
- 由于一个在二分类以外难以满足的严格条件,分类器-拒绝器方法在多分类分类中无法实现校准。
- 基于置信度、使用平滑损失函数(如交叉熵、逻辑回归)的方法可保证在多分类分类中实现对贝叶斯最优解的校准。
- 实证结果表明,基于交叉熵的置信度方法在低拒绝成本(如0.05–0.1)下表现出高准确率和稳定的拒绝率,优于其他方法。
- APC+log 和 OVA+log 方法在 letter 和 vehicle 数据集上表现优异,在 c=0.05 时拒绝率约为 0.7–0.8,准确率超过 0.99。
- 分类器-拒绝器方法(如 APC+exp)在高类别数数据集(如 yeast 和 covtype)上表现较差,尤其在高拒绝成本(如 c=0.4)时准确率显著下降。
- OVA+hin 方法在 yeast 和 covtype 上表现不佳,拒绝率标准差较高(如在 yeast 上 c=0.4 时为 0.3448),表明其结果不稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。