[论文解读] Classification from Positive, Unlabeled and Biased Negative Data
本文提出了一种新颖的 PUbN(正样本-未标记样本-有偏负样本)学习框架,通过基于实例依赖的示例加权策略,将有偏负样本(bN)数据整合到正样本-未标记样本(PU)学习中,实现经验风险最小化,从而提升二分类性能。该方法在 PU 学习基准上实现了最先进(SOTA)性能,并通过基于采样概率估计的两步加权策略,有效利用非代表性负样本,显著提升了泛化能力。
In binary classification, there are situations where negative (N) data are too diverse to be fully labeled and we often resort to positive-unlabeled (PU) learning in these scenarios. However, collecting a non-representative N set that contains only a small portion of all possible N data can often be much easier in practice. This paper studies a novel classification framework which incorporates such biased N (bN) data in PU learning. We provide a method based on empirical risk minimization to address this PUbN classification problem. Our approach can be regarded as a novel example-weighting algorithm, with the weight of each example computed through a preliminary step that draws inspiration from PU learning. We also derive an estimation error bound for the proposed method. Experimental results demonstrate the effectiveness of our algorithm in not only PUbN learning scenarios but also ordinary PU learning scenarios on several benchmark datasets.
研究动机与目标
- 解决从正样本(P)、未标记样本(U)和有偏负样本(bN)数据中学习的挑战,其中 bN 样本不代表真实的负样本分布。
- 通过引入 bN 数据扩展传统 PU 学习,以提升分类器性能,尤其在无法获取完全代表性负样本数据的情况下。
- 开发一种通用、领域无关的方法,不依赖于特定任务的相似性度量或假设。
- 理论上分析在 PUbN 设置下所提出风险估计器的估计误差。
- 在基准数据集上实证验证该方法相较于标准 PU 学习和基线方法的优越性。
提出的方法
- 该方法使用经验风险最小化(ERM)在 P、U 和 bN 数据上训练分类器,将这些样本视为加权示例,以纠正采样偏差。
- 通过在 P 和 bN 数据上训练的初步模型,估计每个样本被采样进入 P 或 bN 集的概率。
- 基于此估计,为每个样本分配权重:若未标记样本(U)更不可能属于 P 或 bN,则赋予更高的权重;正样本(P)则被赋予较小或零权重,以将其视为负样本。
- 分类器通过结合 PU 学习原则与重要性加权的风险估计器进行训练,以纠正负样本数据中的偏差。
- 该方法通过两阶段算法实现:首先估计采样概率,然后使用实例依赖权重训练分类器。
- 当 bN 集为空时,该方法可适配标准 PU 学习,且性能优于现有 SOTA 方法(如 nnPU)。
实验结果
研究问题
- RQ1与标准 PU 学习相比,将有偏负样本(bN)数据整合到 PU 学习中是否能提升分类性能?
- RQ2在无法访问完整负样本分布的情况下,仅使用 P、U 和 bN 集,如何纠正 bN 数据中的采样偏差?
- RQ3在 PUbN 学习框架下,所提出风险估计器的理论估计误差界是什么?
- RQ4当 bN 数据不可用时,该方法在标准 PU 学习任务中是否具有良好的泛化能力?
- RQ5为何该方法在假阳性和假阴性率方面优于现有 PU 学习基线方法(如 nnPU 和 uPU)?
主要发现
- 所提出的 PUbN 方法在多个 PU 学习基准上实现了最先进性能,优于现有 SOTA 方法 nnPU。
- 在 MNIST 和 CIFAR-10 数据集上,以车辆为正样本类时,PUbN 在误分类误差上优于 uPU 和 nnPU,假阳性率与 uPU 相当,假阴性率低于 nnPU。
- 通过主成分分析(PCA)可视化显示,该方法在学习的特征空间中能有效将正样本与负类(如数字 1、3、5)分离,表明具有更好的类别判别能力。
- 使用 bN 数据显著提升了分类器的泛化能力,表现为假阴性率降低,且在多个随机种子下性能稳定。
- 理论分析建立了所提出风险估计器的估计误差界,验证了其在 PUbN 假设下的统计一致性。
- 该方法具有鲁棒性和可泛化性:在标准 PU 学习中(通过省略 bN 数据),其性能仍优于 nnPU,证明了其更广泛的应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。