Skip to main content
QUICK REVIEW

[论文解读] Assessing binary classifiers using only positive and unlabeled data

Marc Claesen, Jesse Davis|arXiv (Cornell University)|Jan 1, 2015
Machine Learning and Data Classification参考文献 31被引用 7
一句话总结

本文提出一种方法,仅使用正样本和未标记样本即可估计二分类器性能指标(如ROC和PR曲线),通过估计未标记集中潜在正样本的比例。该方法通过排名分布分析构建假正例率的上下界,即使在缺乏完整标注测试集的情况下也能实现可靠评估,实证验证表明在真实数据上可准确估计曲线。

ABSTRACT

Assessing the performance of a learned model is a crucial part of machine learning. However, in some domains only positive and unlabeled examples are available, which prohibits the use of most standard evaluation metrics. We propose an approach to estimate any metric based on contingency tables, including ROC and PR curves, using only positive and unlabeled data. Estimating these performance metrics is essentially reduced to estimating the fraction of (latent) positives in the unlabeled set, assuming known positives are a random sample of all positives. We provide theoretical bounds on the quality of our estimates, illustrate the importance of estimating the fraction of positives in the unlabeled set and demonstrate empirically that we are able to reliably estimate ROC and PR curves on real data.

研究动机与目标

  • 解决仅能获得正样本和未标记样本时评估二分类器的挑战,因为标准指标需要完整标注的测试集。
  • 开发一种方法,在无法获取未标记数据真实标签的情况下,估计AUC、精确率和召回率等性能指标。
  • 仅利用预测结果的排序和未标记集中正样本比例的估计值,提供假正例率的理论上下界。
  • 证明朴素假设(如将所有未标记数据视为负样本)可能导致错误的模型选择,凸显需要更精细的评估方法。

提出的方法

  • 利用已知正样本在排名分布上的自 resampling 置信区间,估计未标记集中潜在正样本的比例(β)。
  • 通过分析已知正样本在整体排序中的排名累积分布函数(CDF),在每个排名上构建假正例率的下界和上界。
  • 从这些边界推导列联表,从而在不确定性下估计真正例率、假正例率、精确率和召回率。
  • 利用已知正样本的排名CDF推断替代正样本集,并将不确定性传播至性能指标。
  • 通过将估计的β视为调节假正例率的参数,对ROC和PR曲线构建边界,敏感性分析显示AUC受其影响非均匀。
  • 使用真实世界数据(covtype)进行验证,比较在不同β估计值下,估计边界与真实曲线的差异。

实验结果

研究问题

  • RQ1当仅能获得正样本和未标记样本时,能否可靠估计AUC、精确率和召回率等性能指标?
  • RQ2未标记集中潜在正样本比例的不确定性如何影响估计性能指标的可靠性?
  • RQ3当未知未标记样本的真实标签时,假正例率的理论边界是什么?
  • RQ4天真地假设所有未标记样本均为负样本是否会导致错误的模型选择?若会,如何避免?
  • RQ5在使用不同潜在正样本比例β估计值时,估计的ROC和PR曲线与真实曲线相比如何?

主要发现

  • 该方法成功仅使用正样本和未标记样本即估计出ROC和PR曲线,其边界在covtype数据集上紧密逼近真实性能曲线。
  • 当β估计为49%时,模型1的估计AUC为75.5%(真实值为72.5%),模型2的估计AUC为74.7%(真实值为73.2%),显示出强大的实证准确性。
  • β的置信区间(0.8β至1.2β)所生成的边界包含了真实潜在正样本的排名CDF,验证了自 resampling 估计方法的有效性。
  • PR空间中的估计对β估计误差更为敏感,原因在于精确率对类别平衡的依赖性更强。
  • 已知负样本可略微提升估计质量,通过减少替代正样本分配中的自由度,尽管实际中收益较小。
  • 当存在大量负样本时,若将标签反转(使用1−β),可改善性能边界,提示标签翻转或为潜在优化方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。