Skip to main content
QUICK REVIEW

[论文解读] A plug-in approach to maximising precision at the top and recall at the top

Dirk Tasche|arXiv (Cornell University)|Apr 9, 2018
Machine Learning and Algorithms参考文献 12被引用 5
一句话总结

本文证明,对正类后验概率进行阈值处理可最优地最大化二分类和信息检索中的精确率@k与召回率@k。该方法推广了代价敏感分类,并通过最优阈值处理提供一种即插即用的解决方案,即使在分布不连续及预测正样本率存在各种约束的情况下依然有效。

ABSTRACT

For information retrieval and binary classification, we show that precision at the top (or precision at k) and recall at the top (or recall at k) are maximised by thresholding the posterior probability of the positive class. This finding is a consequence of a result on constrained minimisation of the cost-sensitive expected classification error which generalises an earlier related result from the literature.

研究动机与目标

  • 建立一种理论上最优的即插即用分类器,用于在二分类和信息检索中最大化精确率@k与召回率@k。
  • 将先前关于代价敏感误差约束最小化的结果推广至任意非负代价权重及更广泛的预测正样本率约束。
  • 证明在这些性能指标下,对正类后验概率进行阈值处理可得到最优分类器,即使在分布不连续时也成立。
  • 为评估新型优化算法提供一个实用基准,特别是在精确最优解可解析获得的场景中,如方差相等的双正态模型。

提出的方法

  • 本文提出了一个在预测正样本率约束下,对代价敏感期望分类误差的约束最小化问题。
  • 证明最优分类器是一种随机化决策分类器(RDC),其对正类后验概率在特定分位数处进行阈值处理。
  • 该方法推广了Clémençon和Vayatis(2007)的工作,允许任意非负代价权重(a, b),且满足 a + b > 0。
  • 将结果扩展至后验概率分布不连续的情形,确保在不同类型数据上的鲁棒性。
  • 以方差相等的双正态模型为例,通过分位数估计推导出最优阈值 q 的解析表达式。
  • 该解涉及求解满足 P[P(A|H) > q] = 1 - α 的阈值 q,其中 α 为期望的正样本率。

实验结果

研究问题

  • RQ1能否证明对正类后验概率进行阈值处理可最优地最大化二分类中的精确率@k与召回率@k?
  • RQ2精确率@k与召回率@k的最优分类器与代价敏感分类及Neyman-Pearson引理有何关联?
  • RQ3当后验概率分布不连续时,最优分类器的数学形式是什么?
  • RQ4在实际中,如何计算最优阈值,特别是在方差相等的双正态模型中?
  • RQ5该即插即用方法能否作为评估其他学习算法在精确率@k与召回率@k优化中表现的基准?

主要发现

  • 在特定分位数处对正类后验概率进行阈值处理,可得到最优即插即用分类器,以同时最大化精确率@k与召回率@k。
  • 最优分类器是一种随机化决策分类器(RDC),其将代价敏感贝叶斯分类器推广至受约束的性能度量。
  • 即使后验概率分布不连续,该结果依然成立,扩展了以往仅限于连续情形的研究。
  • 在方差相等的双正态模型中,最优阈值 q 通过涉及标准正态累积分布函数与模型参数的分位数方程求解得出。
  • 解 q 满足 P[P(A|H) > q] = 1 - α,其中 α 为期望的正样本率,且 q 由模型参数唯一确定。
  • 该方法为精确率@k与召回率@k设置下的新型优化算法评估提供了闭式基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。