[论文解读] Positive Unlabeled Contrastive Learning
本文提出了一种正样本-未标记样本对比学习(puCL),一种对比表示学习方法,利用已标记的正样本和未标记数据,在无需类别先验估计的情况下提升下游PU分类性能。该方法引入了一种新颖的对比损失函数以及一种基于聚类的PU特异性伪标签策略,在多个基准测试中实现了最先进性能,尤其在低监督设置下表现突出。
Self-supervised pretraining on unlabeled data followed by supervised fine-tuning on labeled data is a popular paradigm for learning from limited labeled examples. We extend this paradigm to the classical positive unlabeled (PU) setting, where the task is to learn a binary classifier given only a few labeled positive samples, and (often) a large amount of unlabeled samples (which could be positive or negative). We first propose a simple extension of standard infoNCE family of contrastive losses, to the PU setting; and show that this learns superior representations, as compared to existing unsupervised and supervised approaches. We then develop a simple methodology to pseudo-label the unlabeled samples using a new PU-specific clustering scheme; these pseudo-labels can then be used to train the final (positive vs. negative) classifier. Our method handily outperforms state-of-the-art PU methods over several standard PU benchmark datasets, while not requiring a-priori knowledge of any class prior (which is a common assumption in other PU methods). We also provide a simple theoretical analysis that motivates our methods.
研究动机与目标
- 为解决在仅提供少量已标记正样本和大量未标记样本的正样本-未标记样本(PU)设置下训练鲁棒二分类器的挑战。
- 消除对类别先验πp的依赖,这是以往PU方法中的常见假设,但在实际中常不准确或不可用。
- 通过利用已标记正样本提供的弱监督信号,将对比学习适配到PU设置中,以改进表示学习。
- 开发一种可靠的伪标签机制,通过在学习到的表示上进行聚类,生成高质量的负样本预测。
- 在监督信息有限且无需额外辅助信息的前提下,实现PU学习中的最先进性能。
提出的方法
- 提出一种改进的对比损失puCL,通过将已标记正样本作为正样本对,将标准infoNCE对比目标扩展至PU设置。
- 引入一种自监督对比预训练阶段,使用puCL从未标记数据和少量已标记正样本中学习判别性表示。
- 设计一种针对PU任务的聚类方案,基于学习到的表示从未标记集中识别潜在的负样本。
- 利用聚类结果对未标记集应用伪标签,生成用于下游分类器训练的可靠负样本预测。
- 通过在伪标签数据上使用交叉熵损失训练最终二分类器,结合已标记正样本和伪标签负样本。
- 采用两阶段流程:(1) 使用puCL进行对比预训练;(2) 进行伪标签生成后,再进行有监督微调。
实验结果
研究问题
- RQ1对比自监督学习能否有效适配到PU学习设置中,在无需类别先验知识的前提下提升表示质量?
- RQ2在不同监督水平下,所提出的puCL对比目标与标准自监督及有监督对比学习相比,在偏差-方差权衡方面表现如何?
- RQ3当表示充分分离时,基于聚类的伪标签策略是否能有效识别未标记集中的负样本?
- RQ4所提出方法是否在已标记正样本数量较少时,仍能超越现有PU学习基线方法?
- RQ5性能对真实类别先验πp的敏感度如何?当πp未知或估计不准确时,该方法是否仍保持鲁棒性?
主要发现
- puCL在所有评估数据集和监督水平下显著优于标准自监督对比学习(ssCL),尤其在已标记正样本数量较少时性能提升更为明显。
- 所提出的sCL-PU损失(包含类别先验)在πp趋近于0.5时性能下降,当πp接近1时甚至完全崩溃,凸显其对先验估计误差的高度敏感性。
- puCL在不同πp取值下均保持强性能,即使在类别先验未知或估计不准确时仍具鲁棒性,而以往依赖πp的方法则不具备此特性。
- 伪标签步骤(puPL)始终优于nnPU基线,尤其在低监督场景下表现更优,并有效防止了标准交叉熵训练中观察到的模型崩溃现象。
- 伪标签质量与表示分离程度密切相关,表明对比预训练显著提升了下游分类性能。
- 在CIFAR-I、CIFAR-II、FMNIST-I和FMNIST-II上,puCL实现了最先进结果,优于那些假设可访问真实类别先验的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。