Skip to main content
QUICK REVIEW

[论文解读] Collective Loss Function for Positive and Unlabeled Learning

Chenhao Xie, Qiao Cheng|arXiv (Cornell University)|May 6, 2020
Machine Learning and Data Classification参考文献 31被引用 4
一句话总结

该论文提出cPU,一种用于正样本与未标记样本(PU)学习的新型集体损失函数,通过在损失计算前对预测结果进行校正,以解决未标记数据不确定性带来的偏差问题。通过在预测器层面进行集体校正的理论推导,cPU在基准数据集和真实世界数据集上均实现了最先进性能与鲁棒性,在CIFAR-10上的表现优于现有方法1–4个百分点准确率,且在先验估计误差下仍保持稳定结果。

ABSTRACT

People learn to discriminate between classes without explicit exposure to negative examples. On the contrary, traditional machine learning algorithms often rely on negative examples, otherwise the model would be prone to collapse and always-true predictions. Therefore, it is crucial to design the learning objective which leads the model to converge and to perform predictions unbiasedly without explicit negative signals. In this paper, we propose a Collectively loss function to learn from only Positive and Unlabeled data (cPU). We theoretically elicit the loss function from the setting of PU learning. We perform intensive experiments on the benchmark and real-world datasets. The results show that cPU consistently outperforms the current state-of-the-art PU learning methods.

研究动机与目标

  • 解决由于未标记数据中类别不确定性导致的PU学习中偏差风险估计问题。
  • 开发一种对特征工程干预最小化但保持高模型灵活性的方法。
  • 设计一种鲁棒且理论基础坚实的损失函数,通过校正决策边界漂移来避免依赖显式负样本。
  • 通过在损失计算前对预测器进行集体校正,提升PU学习的泛化能力与性能。

提出的方法

  • 该方法引入一种集体预测机制,通过聚合多个预测器的输出以降低未标记数据带来的噪声与不确定性。
  • 通过理论推导获得新的损失函数,重点在于校正预测器而非风险估计器,从而消除类别不确定性带来的偏差。
  • 采用Sigmoid激活的神经网络分类器,并使用改进的损失函数,以考虑在PU约束下的后验概率估计。
  • 集体损失函数被设计为Fisher一致且泛化误差有界,确保收敛至最优决策边界。
  • 通过将未标记数据视为正负样本的混合体,并利用集体推理平衡预测结果,避免显式负样本标注。
  • 该方法端到端应用于深度神经网络,在保持模型容量的同时提升了对不准确类别先验估计的鲁棒性。

实验结果

研究问题

  • RQ1如何设计一种PU学习的损失函数,以避免未标记数据中类别标签不确定性带来的偏差?
  • RQ2在损失计算前进行集体预测校正,是否能比基于风险的校正带来更好的泛化能力与性能?
  • RQ3所提出方法对未标记集中类别先验估计不准确的鲁棒性如何?
  • RQ4该集体损失函数是否在多样化的基准与真实世界数据集上均优于现有最先进PU学习方法?

主要发现

  • cPU在所有基准数据集上持续优于最先进PU学习方法,在具有挑战性的CIFAR-10数据集上准确率提升1–4个百分点。
  • 在MNIST、USPS、SVHN和20ng数据集上,cPU保持高性能且标准差极小,表明其具有极强的稳定性。
  • 该方法对类别先验估计错误具有鲁棒性:即使未标记数据中正样本先验波动±10%,性能波动仍处于可接受范围。
  • 训练过程可视化显示,未标记的正样本(如狗)逐渐向正样本簇移动,而模糊或噪声样本则在决策边界附近震荡。
  • 案例研究显示,模型预测受标签信号与视觉相似性引导,误分类主要发生在模糊或含人类的图像上。
  • 理论分析证实,集体损失函数具有Fisher一致性,且泛化误差有界,支持收敛至最优决策边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。