Skip to main content
QUICK REVIEW

[论文解读] No Cost Likelihood Manipulation at Test Time for Making Better Mistakes in Deep Networks

Shyamgopal Karthik, Ameya Prabhu|arXiv (Cornell University)|Apr 1, 2021
Imbalanced Data Classification Techniques参考文献 30被引用 6
一句话总结

该论文提出一种基于条件风险最小化(CRM)的后训练推理阶段校正方法,通过利用标签层次结构重加权Softmax概率,无需微调即可改善深度学习分类器的错误严重性。CRM在多个数据集上显著降低了top-k预测的平均层次距离,同时仅带来微小的准确率下降,优于当前最先进的层次感知方法,且保持了模型的校准性。

ABSTRACT

There has been increasing interest in building deep hierarchy-aware classifiers that aim to quantify and reduce the severity of mistakes, and not just reduce the number of errors. The idea is to exploit the label hierarchy (e.g., the WordNet ontology) and consider graph distances as a proxy for mistake severity. Surprisingly, on examining mistake-severity distributions of the top-1 prediction, we find that current state-of-the-art hierarchy-aware deep classifiers do not always show practical improvement over the standard cross-entropy baseline in making better mistakes. The reason for the reduction in average mistake-severity can be attributed to the increase in low-severity mistakes, which may also explain the noticeable drop in their accuracy. To this end, we use the classical Conditional Risk Minimization (CRM) framework for hierarchy-aware classification. Given a cost matrix and a reliable estimate of likelihoods (obtained from a trained network), CRM simply amends mistakes at inference time; it needs no extra hyperparameters and requires adding just a few lines of code to the standard cross-entropy baseline. It significantly outperforms the state-of-the-art and consistently obtains large reductions in the average hierarchical distance of top-$k$ predictions across datasets, with very little loss in accuracy. CRM, because of its simplicity, can be used with any off-the-shelf trained model that provides reliable likelihood estimates.

研究动机与目标

  • 解决现有层次感知深度学习模型的局限性,即其会增加低严重性错误,从而削弱实际应用价值,尽管其指标得分有所提升。
  • 表明当前的错误严重性度量可能具有误导性,倾向于偏好产生更多低严重性错误而非更少高严重性错误的模型。
  • 提出并验证一种简单、后训练的推理阶段校正方法,基于条件风险最小化(CRM),在不微调或调整超参数的情况下改善预测排名。
  • 证明CRM在显著降低top-k预测中层次距离的同时,保持了模型的校准性和准确性。
  • 倡导复兴经典CRM方法,作为复杂、依赖微调的层次感知方法的实用且高效的替代方案。

提出的方法

  • 在推理阶段应用条件风险最小化(CRM),基于预定义的代价矩阵(反映标签层次结构)对类别概率进行重加权。
  • 将标准交叉熵训练模型的Softmax输出作为CRM的概率输入估计。
  • 将错误严重性定义为预测标签与真实标签在层次结构(如WordNet)中的图距离(例如,最低共同祖先的高度)。
  • 将风险最小化问题表述为最小化预测的期望层次距离,通过概率的闭式更新求解。
  • 将CRM作为轻量级后处理步骤集成,仅需几行代码,无需额外超参数或模型微调。
  • 使用温度缩放提升基线模型的校准性,但表明CRM概率即使不使用温度缩放也保持良好校准。

实验结果

研究问题

  • RQ1当前层次感知学习中使用的错误严重性度量是否真正反映错误质量,还是可能被通过增加低严重性错误而操纵?
  • RQ2能否通过一种简单、后训练的推理阶段校正方法,优于复杂的、依赖微调的层次感知深度学习方法,以降低top-k预测的层次距离?
  • RQ3在训练过程中引入标签层次结构如何影响模型校准性?是否降低概率可靠性?
  • RQ4经典方法如CRM是否可在现代深度学习中有效复兴,以同时改善排名、准确率和校准性?
  • RQ5是否存在一种实用、低成本的替代方案,可在不进行训练阶段层次结构集成的前提下,保持模型可靠性与性能?

主要发现

  • CRM在多个数据集(包括tiered-ImageNet和iNaturalist-H)上显著降低了top-k预测的平均层次距离,优于当前最先进的方法。
  • CRM的改进在k=1至k=5范围内保持一致,显著降低层次距离,同时保持或略微降低top-1准确率。
  • 使用层次感知损失训练的模型(如软标签、HXE、标签平滑)表现出严重校准偏差,校准误差(ECE)最高达88.32%(未使用温度缩放前)。
  • 温度缩放可减少基线模型的校准偏差,但无法使其接近原始交叉熵基线或CRM预测的校准水平。
  • 即使不使用温度缩放,CRM概率仍保持良好校准,且CRM预测的ECE/MCE得分与原始交叉熵模型几乎完全一致。
  • 所提方法无需微调、无需超参数,仅需几行代码,可轻松集成到任何提供可靠概率输出的现成深度神经网络中,具有高度可部署性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。