[论文解读] Mixture Proportion Estimation and PU Learning: A Modern Approach
该论文提出了最佳分箱估计(BBE)用于混合比例估计,以及条件值忽略风险(CVIR)用于PU学习,实现了在高维设置下正类与负类分类的高精度。结合两种方法的迭代TED框架在温和假设下具备理论保证,且在视觉、自然语言处理和表格数据集上均达到最先进性能。
Given only positive examples and unlabeled examples (from both positive and negative classes), we might hope nevertheless to estimate an accurate positive-versus-negative classifier. Formally, this task is broken down into two subtasks: (i) Mixture Proportion Estimation (MPE) -- determining the fraction of positive examples in the unlabeled data; and (ii) PU-learning -- given such an estimate, learning the desired positive-versus-negative classifier. Unfortunately, classical methods for both problems break down in high-dimensional settings. Meanwhile, recently proposed heuristics lack theoretical coherence and depend precariously on hyperparameter tuning. In this paper, we propose two simple techniques: Best Bin Estimation (BBE) (for MPE); and Conditional Value Ignoring Risk (CVIR), a simple objective for PU-learning. Both methods dominate previous approaches empirically, and for BBE, we establish formal guarantees that hold whenever we can train a model to cleanly separate out a small subset of positive examples. Our final algorithm (TED)$^n$, alternates between the two procedures, significantly improving both our mixture proportion estimator and classifier
研究动机与目标
- 解决经典方法与近期启发式方法在高维数据下混合比例估计(MPE)和PU学习中的局限性。
- 开发一种理论基础坚实、鲁棒的混合比例估计方法,用于无标签数据中正样本比例的估计,且无需依赖超参数调优。
- 设计一种PU学习目标,通过丢弃高损失样本避免对无标签正样本的过拟合。
- 将MPE与PU学习整合进一个迭代框架,同时提升混合比例估计与分类器准确率。
- 在温和假设下,为BBE建立有限样本统计保证,特别是当存在一个可分的正样本子域时。
提出的方法
- BBE通过识别一个阈值来估计混合比例α,该阈值使高于该阈值的正样本与无标签样本比例的上置信区间最小化。
- 该方法利用训练好的正类对无标签(PvU)分类器生成表示正样本可能性的得分,假设得分分布具有单调校准性。
- CVIR用于PU学习,通过在每个训练周期内丢弃损失最高的α比例的训练样本,减少对无标签正样本的过拟合。
- TED框架在BBE进行MPE与CVIR进行PU学习之间交替迭代,持续优化混合比例估计与分类器。
- 该方法兼容任意假设类,包括深度神经网络,且无需重新校准或大量超参数调优。
- 理论分析表明,BBE在温和条件下达到O(1/√n)的收敛速率,尤其当存在一个可分的正样本子域时。
实验结果
研究问题
- RQ1我们能否在经典方法失效的高维设置下,实现一致且理论可靠的混合比例估计?
- RQ2我们能否设计一种对无标签数据过拟合具有鲁棒性的PU学习目标,且无需依赖超参数调优?
- RQ3将MPE与PU学习整合进迭代框架是否能显著提升估计与分类性能?
- RQ4BBE在何种条件下可实现最优统计速率?其在实际应用中与现有MPE方法相比表现如何?
- RQ5所提出方法能否在视觉、自然语言处理和具有重叠支持的表格数据等多样化数据类型上实现泛化?
主要发现
- 在使用ResNet-18的binary-CIFAR数据集上,TED显著优于基线PvU训练,在分类准确率与MPE估计方面均有提升。
- 在UCI数据集上,TED实现了最低的绝对估计误差(0.001–0.007)与最高的准确率(蘑菇数据集98.7%,pageblock数据集95.7%),全面超越所有基线方法。
- 在MNIST Overlap(类别支持重叠)数据集上,TED实现了最低的MPE误差(0.035)与最高的准确率(79.0%),优于所有对比方法。
- 在IMDb数据集上使用BERT,TED达到87.6%的准确率,领先次佳方法1.4个百分点。
- BBE实现了稳定的一致性估计并具备有限样本保证,其性能在不同α值与数据复杂度的数据集上均保持稳定。
- 基于CVIR的训练展现出对过拟合的强鲁棒性,即使在α未知时也能持续提升准确率,优于nnPU与uPU等方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。