Skip to main content
QUICK REVIEW

[论文解读] Theoretical Comparisons of Learning from Positive-Negative, Positive-Unlabeled, and Negative-Unlabeled Data

Gang Niu, Marthinus Christoffel du Plessis|arXiv (Cornell University)|Mar 10, 2016
Machine Learning and Data Classification被引用 3
一句话总结

本文从理论上比较了PU(正样本-未标记样本)学习与NU(负样本-未标记样本)学习相对于传统PN(正样本-负样本)学习的性能,证明了在未标记数据无限的情况下,PU或NU学习几乎总是优于PN学习。该研究为PU学习在缺乏负样本的情况下仍能超越监督式PN学习这一经验观察提供了理论基础。

ABSTRACT

In PU learning, a binary classifier is trained only from positive (P) and unlabeled (U) data without negative (N) data. Although N data is missing, it sometimes outperforms PN learning (i.e., supervised learning) in experiments. In this paper, we theoretically compare PU (and the opposite NU) learning against PN learning, and prove that, one of PU and NU learning given infinite U data will almost always improve on PN learning. Our theoretical finding is also validated experimentally.

研究动机与目标

  • 从理论上分析PU和NU学习相对于传统PN学习的性能。
  • 研究当未标记数据充足时,PU或NU学习是否能超越PN学习。
  • 为PU学习在缺少负样本的情况下仍优于PN学习这一经验观察提供形式化解释。
  • 建立PU或NU学习在未标记数据增长时优于PN学习的条件。

提出的方法

  • 对PU、NU和PN学习框架下二分类性能的理论分析。
  • 利用无限未标记数据,比较PU、NU和PN学习的泛化误差界。
  • 推导PU或NU学习在渐近意义上优于PN学习的条件。
  • 使用概率和统计模型,形式化数据分布与学习性能之间的关系。
  • 证明在未标记数据无限的条件下,PU或NU学习几乎必然优于PN学习。

实验结果

研究问题

  • RQ1在什么条件下PU学习优于PN学习?
  • RQ2当未标记数据充足时,NU学习是否也能超越PN学习?
  • RQ3是否存在理论基础解释PU学习在缺少负样本情况下的经验成功?
  • RQ4当未标记数据趋近于无穷时,PU、NU和PN学习的泛化误差如何比较?

主要发现

  • 在未标记数据无限的情况下,PU或NU学习几乎必然优于PN学习。
  • 理论优势源于PU和NU学习能更有效地利用未标记数据来估计决策边界。
  • PU和NU学习不会同时保证优于PN学习,但至少有一者在渐近意义上会主导PN学习。
  • 该结果为PU学习在经验上通常优于PN学习的现象提供了理论解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。