Skip to main content
QUICK REVIEW

[论文解读] MixPUL: Consistency-based Augmentation for Positive and Unlabeled Learning

Wei Tong, Feng Shi|arXiv (Cornell University)|Apr 20, 2020
Machine Learning and Data Classification参考文献 24被引用 4
一句话总结

MixPUL 提出了一种基于一致性的数据增强方法,用于正样本与未标记样本(PU)学习,该方法结合了 mixup 和有监督/无监督的一致性正则化,无需依赖类别先验知识。通过从未标记数据中挖掘可靠的负样本并应用边缘损失,该方法在不同正样本集大小下,使 CIFAR-10 上的分类错误率相对降低了 20.6%(从 16.49 降至 13.09),同时提升了 AUC 性能。

ABSTRACT

Learning from positive and unlabeled data (PU learning) is prevalent in practical applications where only a couple of examples are positively labeled. Previous PU learning studies typically rely on existing samples such that the data distribution is not extensively explored. In this work, we propose a simple yet effective data augmentation method, coined~\algo, based on \emph{consistency regularization} which provides a new perspective of using PU data. In particular, the proposed~\algo~incorporates supervised and unsupervised consistency training to generate augmented data. To facilitate supervised consistency, reliable negative examples are mined from unlabeled data due to the absence of negative samples. Unsupervised consistency is further encouraged between unlabeled datapoints. In addition,~\algo~reduces margin loss between positive and unlabeled pairs, which explicitly optimizes AUC and yields faster convergence. Finally, we conduct a series of studies to demonstrate the effectiveness of consistency regularization. We examined three kinds of reliable negative mining methods. We show that~\algo~achieves an averaged improvement of classification error from 16.49 to 13.09 on the CIFAR-10 dataset across different positive data amount.

研究动机与目标

  • 为解决现有 PU 学习方法依赖类别先验估计的局限性,此类估计常不准确并导致性能下降。
  • 通过在有标签和无标签数据上应用 mixup 的一致性正则化,提升 PU 学习中的泛化能力和 AUC 性能。
  • 开发一种鲁棒的、无需先验知识的方法,有效利用未标记数据而不假设已知的数据分布。
  • 在缺乏真实负样本标签的情况下,评估不同可靠负样本挖掘策略的有效性。
  • 证明一致性正则化与边缘损失的联合使用可加速收敛并提升模型稳定性。

提出的方法

  • MixPUL 通过插值正样本与未标记样本对及其标签,应用基于 mixup 的一致性正则化,促使模型对插值标签的预测保持一致。
  • 通过从未标记数据中挖掘可靠的负样本,引入有监督的一致性损失,以模拟负样本监督,从而实现更好的泛化性能。
  • 通过对未标记数据点应用 mixup,强制实施无监督的一致性损失,以提升数据流形低密度区域的鲁棒性。
  • 在正样本与未标记样本对之间引入边缘损失,以显式最小化 AUC 风险,鼓励模型对正样本具有更高的置信度。
  • 将 mixup、负样本挖掘与边缘损失整合到统一的目标函数中,联合优化 AUC 与一致性。
  • 评估了三种负样本挖掘技术:基于距离的方法(Dist)、NTC(随机森林)和随机下采样(Rand),其中 Rand 表现最优。

实验结果

研究问题

  • RQ1通过 mixup 实现基于一致性的数据增强是否能在不依赖类别先验估计的情况下提升 PU 学习性能?
  • RQ2在缺乏真实负样本标签的情况下,不同可靠的负样本挖掘策略的有效性如何?
  • RQ3对未标记数据应用无监督 mixup 是否能提升 PU 学习中的模型泛化能力和收敛速度?
  • RQ4在正样本与未标记样本对之间引入边缘损失在多大程度上能提升 AUC 性能与模型稳定性?
  • RQ5与 uPU 和 nnPU 等前沿 PU 学习方法相比,mixup、负样本挖掘与边缘损失的组合表现如何?

主要发现

  • 在不同正样本集大小下,MixPUL 在 CIFAR-10 上的平均分类错误率从 16.49 降低至 13.09,相对性能提升了 20.6%。
  • 随机负样本挖掘方法优于基于距离和 NTC 的方法,尤其在低数据场景下表现更优。
  • 对未标记数据应用无监督 mixup 显著提升了泛化能力,即使在初始训练阶段出现不稳定性后,错误率仍能降至 10% 以下。
  • 引入边缘损失可加快收敛速度并提升训练稳定性,尤其在与 mixup 结合时效果更明显。
  • 即使未获取真实类别先验值,MixPUL 仍优于前沿方法 uPU 和 nnPU,尤其在正样本稀缺时表现更优。
  • 消融实验表明,所有组件——mixup、边缘损失与负样本挖掘——均不可或缺;移除任一组件均会导致性能下降或模型崩溃。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。