[论文解读] Learning from Positive and Unlabeled Data under the Selected At Random Assumption
本文提出SAR-EM,一种基于期望最大化(EM)的PU学习方法,适用于在选择随机(Selected At Random, SAR)假设下从正样本和未标记样本中学习,其中正样本被标记的概率取决于其属性(倾向性得分)。该方法在SCAR假设下表现优于最先进方法,并且在真实倾向性得分未知时仍能实现接近最优的性能,证明了其对强SCAR假设违反情况的鲁棒性。
For many interesting tasks, such as medical diagnosis and web page classification, a learner only has access to some positively labeled examples and many unlabeled examples. Learning from this type of data requires making assumptions about the true distribution of the classes and/or the mechanism that was used to select the positive examples to be labeled. The commonly made assumptions, separability of the classes and positive examples being selected completely at random, are very strong. This paper proposes a weaker assumption that assumes the positive examples to be selected at random, conditioned on some of the attributes. To learn under this assumption, an EM method is proposed. Experiments show that our method is not only very capable of learning under this assumption, but it also outperforms the state of the art for learning under the selected completely at random assumption.
研究动机与目标
- 为解决PU学习中强假设的局限性,例如选择完全随机(SCAR)假设,该假设假设所有正样本具有相同的标记概率。
- 提出一种更弱、更现实的假设——选择随机(SAR)假设,其中标记概率取决于属性子集(倾向性得分)。
- 开发一种基于EM的有效算法SAR-EM,能够在不依赖真实倾向性得分先验知识的情况下,基于SAR假设进行学习。
- 通过实证验证,SAR-EM的性能几乎与已知真实倾向性得分时相当,并且错误地使用SCAR假设会降低性能。
提出的方法
- SAR假设将标记概率建模为已知属性子集的函数,引入随样本变化的倾向性得分。
- SAR-EM算法采用期望最大化框架:E步中,估计每个未标记样本为正类的后验概率;M步中,更新分类器和倾向性得分模型。
- 该方法将问题视为一系列SCAR问题的混合,每个对应于倾向性相关属性的配置,从而实现局部类先验估计。
- 通过迭代优化,联合学习分类器和倾向性得分函数,提升预测准确率和倾向性估计的精度。
- 在已知和未知倾向性得分设置下评估该方法,包括SAR-e(已知)和SAR-EM(未知)。
- 在多个现实世界数据集上应用该算法,测试其在不同程度偏离SCAR假设下的鲁棒性。
实验结果
研究问题
- RQ1能否开发一种对SCAR假设违反具有鲁棒性的PU学习方法,即正样本的标记概率在不同正样本间不恒定?
- RQ2当真实标记机制已知或未知时,SAR-EM的性能与最先进方法相比如何?
- RQ3当真实机制为SAR但错误假设为SCAR时,分类器性能是否会下降?若会,下降程度如何?
- RQ4在SAR假设下,SAR-EM能否从数据中准确重构潜在的倾向性得分函数?
- RQ5在正类先验分布偏斜的不平衡领域中,SAR-EM是否依然有效?
主要发现
- SAR-EM的性能几乎与SAR-e(使用真实倾向性得分)相当,表明该方法无需先验知识即可有效学习标记机制。
- 当SCAR假设被违反时,错误假设SCAR会导致显著的性能下降,尤其在标记概率不恒定时更为明显。
- 在SCAR假设不成立的设置中,SAR-EM优于最先进SCAR基方法,证明了其鲁棒性。
- 在不平衡领域中,已知真实类先验(通过SCAR-c或SAR-e)具有明显优势,但SAR-EM在无此类知识时仍能实现强性能。
- SAR-EM在估计分类器F1得分和倾向性得分方面均表现出高精度,F1得分在偏离SCAR的数据集上始终优于基于SCAR的方法。
- 该方法在多样化数据集上展现出强泛化能力,包括Sci-Rec、Talk-Rec和Comp-Talk,F1得分根据数据结构在0.60至0.80之间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。