Skip to main content
QUICK REVIEW

[论文解读] Combining Human Predictions with Model Probabilities via Confusion Matrices and Calibration

Gavin Kerrigan, Padhraic Smyth|arXiv (Cornell University)|Sep 29, 2021
Machine Learning and Algorithms参考文献 8被引用 7
一句话总结

本文提出了一种新颖的方法,通过混淆矩阵和校准技术将人类分类标签与模型概率输出相结合,显著提升了准确率和校准度,优于单独使用人类或模型的结果。该方法仅需极少的标注数据(最少10个样本),并在CIFAR-10H和ImageNet-16H数据集上表现出一致的性能提升。

ABSTRACT

An increasingly common use case for machine learning models is augmenting the abilities of human decision makers. For classification tasks where neither the human or model are perfectly accurate, a key step in obtaining high performance is combining their individual predictions in a manner that leverages their relative strengths. In this work, we develop a set of algorithms that combine the probabilistic output of a model with the class-level output of a human. We show theoretically that the accuracy of our combination model is driven not only by the individual human and model accuracies, but also by the model's confidence. Empirical results on image classification with CIFAR-10 and a subset of ImageNet demonstrate that such human-model combinations consistently have higher accuracies than the model or human alone, and that the parameters of the combination method can be estimated effectively with as few as ten labeled datapoints.

研究动机与目标

  • 开发一种实用且标签高效的多分类任务方法,用于结合人类预测(类别级标签)与机器学习模型的概率输出。
  • 通过利用人类与模型之间互补的错误模式,提升分类准确率与校准度。
  • 从理论和实证两方面分析模型置信度与人类错误多样性如何共同影响联合性能。
  • 即使在人类或模型单独表现不佳的情况下,也能实现有效的机器-人类协作。
  • 提供一种仅需极少标注数据的框架——在仅10个标注样本的情况下即展现出有效性。

提出的方法

  • 该方法使用潜在真实标签的联合概率框架,对人类的混淆矩阵和模型的校准参数进行建模。
  • 采用EM算法,从未标注数据(包含模型概率输出和人类标签)中估计模型校准参数与人类混淆矩阵参数。
  • E步根据人类标签和模型输出计算真实标签的后验概率;M步通过最大似然或MAP估计更新参数。
  • 对于混淆矩阵,基于期望的人类标签分布使用闭式更新;对于模型校准,则采用基于梯度的优化方法。
  • 该框架支持多种估计策略,包括逻辑回归、仅混淆矩阵(SP)以及完全贝叶斯P+L方法。
  • 通过引入狄利克雷先验提升低数据场景下的鲁棒性,尤其在完全贝叶斯变体中表现显著。

实验结果

研究问题

  • RQ1将人类的类别级预测与模型的概率输出相结合,是否能获得高于单独使用人类或模型的准确率?
  • RQ2模型校准与人类混淆矩阵特性如何共同影响联合系统的性能?
  • RQ3有效训练组合模型所需的最少标注数据量是多少?
  • RQ4模型置信度与人类错误模式的差异如何影响最终预测的准确率与校准度?
  • RQ5当模型本身准确率较低时,该组合方法是否仍能超越人类与模型各自的性能?

主要发现

  • 在CIFAR-10H上,人类-机器组合方法的平均错误率为2.85%,优于单独的人类(4.62%)与模型(6.10%)。
  • 在ImageNet-16H上,组合方法将错误率降低至6.62%,而人类与模型单独的错误率分别为9.99%与11.1%。
  • P+L(完全贝叶斯)方法在大多数设置下达到最低错误率,尽管其对数据量与计算资源要求更高。
  • SP方法虽具有标签效率,但常出现欠拟合,尤其在数据有限时表现不如P+L。
  • 在CIFAR-10H上,逻辑回归方法标签效率较低,但在使用数百个标注样本训练时,其性能优于P+L;在ImageNet-16H上则表现更优。
  • 该方法在仅10个标注样本的情况下即实现显著性能提升,展现出强大的标签效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。