Skip to main content
QUICK REVIEW

[论文解读] Estimating Accuracy from Unlabeled Data: A Probabilistic Logic Approach

Emmanouil Antonios Platanios, Hoifung Poon|arXiv (Cornell University)|May 19, 2017
Bayesian Modeling and Causal Inference参考文献 10被引用 19
一句话总结

该论文提出了一种基于概率逻辑的方法,仅利用未标注数据并通过利用类别之间的逻辑约束(如互斥性)来估计分类器准确率。该方法将分类器输出建模为软概率,使用马尔可夫随机场与概率软逻辑进行推理,误差率估计结果与真实准确率的偏差在3-5%以内,在四个真实世界数据集上优于当前最先进方法。

ABSTRACT

We propose an efficient method to estimate the accuracy of classifiers using only unlabeled data. We consider a setting with multiple classification problems where the target classes may be tied together through logical constraints. For example, a set of classes may be mutually exclusive, meaning that a data instance can belong to at most one of them. The proposed method is based on the intuition that: (i) when classifiers agree, they are more likely to be correct, and (ii) when the classifiers make a prediction that violates the constraints, at least one classifier must be making an error. Experiments on four real-world data sets produce accuracy estimates within a few percent of the true accuracy, using solely unlabeled data. Our models also outperform existing state-of-the-art solutions in both estimating accuracies, and combining multiple classifier outputs. The results emphasize the utility of logical constraints in estimating accuracy, thus validating our intuition.

研究动机与目标

  • 在无需标注数据的情况下估计分类器准确率,从而适用于无监督学习与众包场景。
  • 利用分类输出之间的逻辑约束(如互斥性)来提升准确率估计的精度。
  • 开发一种可扩展的方法,整合未标注数据与可用的标注数据,实现半监督准确率估计。
  • 在真实标签未知的情况下,通过约束感知的概率推理推断每个实例最可能的真实标签。
  • 在仅使用未标注数据的前提下,优于现有最先进方法,在误差率估计与标签预测两方面均表现更优。

提出的方法

  • 将分类器输出建模为[0, 1]区间内的软概率,表示预测的置信度。
  • 将逻辑约束(如互斥性)表示为马尔可夫随机场(MRF)中的概率规则。
  • 使用改进的概率软逻辑(PSL)框架,在MRF上实现高效的概率推理。
  • 应用启发式实例化算法与随机一致性ADMM,实现对包含数百万实例的大规模数据集的可扩展处理。
  • 通过识别违反逻辑约束的不一致预测来估计分类器误差率。
  • 通过最大后验概率(MAP)推理,同时推断每个实例最可能的真实标签。

实验结果

研究问题

  • RQ1能否仅使用未标注数据与逻辑约束可靠地估计分类器准确率?
  • RQ2在无真实标签的情况下,逻辑约束(如互斥性)在提升准确率估计方面的有效性如何?
  • RQ3该方法能否在包含数百万实例与多个分类任务的大规模数据集上实现可扩展性?
  • RQ4在误差率估计与标签预测两方面,该方法与最先进方法相比表现如何?
  • RQ5该方法在缺乏逻辑约束的场景下,其泛化能力如何?

主要发现

  • 所提方法在所有四个数据集上的误差率估计平均绝对偏差(MAD)均在真实误差率的3-5%以内。
  • 在具有逻辑约束的NELL-7与NELL-11数据集上,该方法在MAD与AUC两项指标上均优于所有基线方法,MAD最低达3.71,AUC最高达0.615。
  • 即使在无逻辑约束的uNELL与uBRAIN数据集上,该方法在误差率估计MAD方面仍持续优于所有基线方法,在10次比较中有8次取得最佳结果。
  • 该方法具有高效可扩展性,在15英寸MacBook Pro上完成推理耗时不足10分钟,而表现第二好的HCBEE则需约100分钟。
  • 在仅使用未标注数据的uNELL-All数据集上,该方法AUC达0.998,显著优于次优方法BEE的0.795。
  • 该方法成功以高精度推断出最可能的真实标签,所有数据集上均表现出高AUC分数,即使在无标注数据的情况下亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。