[论文解读] Revisiting Sample Selection Approach to Positive-Unlabeled Learning: Turning Unlabeled Data into Positive rather than Negative
该论文提出aaPU,一种新颖的正例-未标记(PU)学习方法,通过利用深度网络的记忆特性,在训练过程中选择高损失的未标记样本作为伪正例数据。通过一种新的学习目标对这些有偏的伪正例样本进行重加权,aaPU在CIFAR-10、CIFAR-100和20Newsgroups数据集上均优于最先进的重要性重加权方法(如nnPU),表明在深度学习设置中,样本选择可超越重要性重加权。
In the early history of positive-unlabeled (PU) learning, the sample selection approach, which heuristically selects negative (N) data from U data, was explored extensively. However, this approach was later dominated by the importance reweighting approach, which carefully treats all U data as N data. May there be a new sample selection method that can outperform the latest importance reweighting method in the deep learning age? This paper is devoted to answering this question affirmatively---we propose to label large-loss U data as P, based on the memorization properties of deep networks. Since P data selected in such a way are biased, we develop a novel learning objective that can handle such biased P data properly. Experiments confirm the superiority of the proposed method.
研究动机与目标
- 探究现代样本选择方法是否能在深度PU学习中超越重要性重加权方法。
- 解决利用深度网络从未标记数据集中选择有偏伪正例数据所面临的挑战。
- 开发一种新的学习目标,以恰当处理从未标记数据中选择高损失样本作为正例所引入的偏差。
- 在真实世界和合成数据集上,证明该方法相对于现有重要性重加权方法(如nnPU)的优越性。
提出的方法
- 基于深度网络的记忆特性,选择交叉熵损失最高的未标记样本(以-1作为真实标签)作为伪正例数据。
- 提出一种新型学习目标,以考虑所选伪正例样本中的偏差,避免对经验风险的低估。
- 在验证损失稳定后,从后续训练轮次开始,将选定的伪正例数据永久添加到训练集中。
- 采用动态数据添加策略,根据数据集和模型规模,每轮添加150、160或320个样本。
- 使用标准的深度学习架构(如CIFAR数据集使用ResNet类网络,20Newsgroups使用MLP),并配合自适应学习率和权重衰减调度策略。
- 该方法为端到端在线学习,每轮训练后更新训练集,加入新的伪正例数据。
实验结果
研究问题
- RQ1能否通过从未标记数据集中选择正例数据的样本选择方法,在深度PU学习中超越现代重要性重加权方法?
- RQ2如何利用深度网络的行为可靠地识别高损失的未标记样本作为伪正例数据?
- RQ3需要何种学习目标才能有效处理从未标记数据中选择伪正例样本所引入的固有偏差?
- RQ4在训练的哪个阶段以及以何种频率添加伪正例样本,可使性能达到最优?
主要发现
- aaPU在CIFAR-10、CIFAR-100和20Newsgroups三个基准数据集上均优于nnPU,表现更优。
- 在CIFAR-100和20Newsgroups上,aaPU相对于nnPU的性能提升尤为显著,且在60–100轮后开始显现。
- 该方法在10次重复实验中均表现出一致的性能提升,报告的平均准确率与方差表明其具有鲁棒性。
- 性能增益仅在经过足够多轮训练后才显现,表明该方法在添加伪正例数据前,依赖于模型表示的稳定性。
- 每轮添加伪正例样本的最优数量范围为[40, 80, 160, 320],在较大数据集上,160–320个样本的添加量效果最佳。
- 即使在使用复杂深度网络时,该方法依然有效,成功克服了传统样本选择在深度学习中易导致过拟合的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。