[论文解读] Positive-Unlabeled Learning using Random Forests via Recursive Greedy Risk Minimization
本文提出PU Extra Trees,一种新颖的随机森林算法,用于正样本-未标记样本(PU)学习,将决策树学习建模为递归贪心风险最小化。通过直接最小化PU特异性风险估计器(如非负PU风险),该方法在极少超参数调优下实现优异性能,并引入一种特征重要性评分,量化每个特征对风险降低的贡献,其在多个数据集上的表现优于当前最先进方法。
The need to learn from positive and unlabeled data, or PU learning, arises in many applications and has attracted increasing interest. While random forests are known to perform well on many tasks with positive and negative data, recent PU algorithms are generally based on deep neural networks, and the potential of tree-based PU learning is under-explored. In this paper, we propose new random forest algorithms for PU-learning. Key to our approach is a new interpretation of decision tree algorithms for positive and negative data as \emph{recursive greedy risk minimization algorithms}. We extend this perspective to the PU setting to develop new decision tree learning algorithms that directly minimizes PU-data based estimators for the expected risk. This allows us to develop an efficient PU random forest algorithm, PU extra trees. Our approach features three desirable properties: it is robust to the choice of the loss function in the sense that various loss functions lead to the same decision trees; it requires little hyperparameter tuning as compared to neural network based PU learning; it supports a feature importance that directly measures a feature's contribution to risk minimization. Our algorithms demonstrate strong performance on several datasets. Our code is available at \url{https://github.com/puetpaper/PUExtraTrees}.
研究动机与目标
- 为解决树模型在正样本-未标记样本(PU)学习中尚未被充分探索的潜力,尤其与主流深度学习方法相比。
- 通过将基于不纯度的分裂解释为风险最小化,为直接在PU数据上训练决策树提供一个系统性框架。
- 将该框架扩展至随机森林,构建一种超参数调优极少的高效PU学习算法。
- 提出一种新的特征重要性度量,直接反映特征在PU设定下对最小化期望风险的贡献。
- 证明树模型在PU学习中可达到与当前最先进神经网络方法相媲美甚至更优的性能。
提出的方法
- 提出一种递归贪心风险最小化框架,将标准基于不纯度的决策树学习重新解释为使用特定损失函数的期望风险最小化。
- 通过基于非负PU风险(nnPU)设计风险估计器,将该框架扩展至PU学习,实现对PU数据上期望风险的直接最小化。
- 开发一种新型决策树算法,其分裂选择基于PU风险的最大降幅,而非不纯度降低,采用如二次损失或逻辑损失等损失函数。
- 通过自助采样与特征子采样组合多个PU决策树,构建随机森林变体PU Extra Trees,确保模型的鲁棒性与泛化能力。
- 提出一种基于风险降低的特征重要性评分,量化每个特征对模型整体风险降低的贡献。
- 采用基于风险降低阈值或最大树深度的停止准则,为模型过拟合控制提供系统性替代方案,而非启发式方法。
实验结果
研究问题
- RQ1决策树学习能否被重新解释为正负样本与正未标记样本数据的递归贪心风险最小化?
- RQ2直接最小化PU特异性风险估计器是否在PU学习中优于传统的基于不纯度的分裂策略?
- RQ3基于树的PU学习方法是否能在显著减少超参数调优的前提下,实现与当前最先进深度学习模型相当的性能?
- RQ4所提出的基于风险的特征重要性评分是否在PU设定下比标准重要性度量更具可解释性与实际意义?
- RQ5该方法对不同损失函数的选择是否具有鲁棒性?其在多样化数据集上是否保持一致的性能表现?
主要发现
- PU Extra Trees在多个基准数据集(包括UNSW-NB15和MNIST)上达到最先进性能,AUC与准确率表现优异。
- 在UNSW-NB15数据集上,PU Extra Trees的AUC达到85.65(0.59),在AUC与F1-score上均优于其他PU与PN基线方法。
- 所提出的基于风险降低的特征重要性评分在视觉与定性上与标准PN随机森林的评分相似,表明PU模型学习到了可比且有意义的表征。
- 该方法对损失函数选择表现出鲁棒性:不同损失函数(二次、逻辑)生成完全相同的决策树,表明模型结构具有高度稳定性。
- 与基于神经网络的PU方法相比,该算法所需超参数调优极少,更具实际部署可行性。
- 特征重要性评分与直观模式一致——例如在MNIST中,高重要性像素对应数字形状,验证了其可解释性与相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。