[论文解读] Learning from Multiple Corrupted Sources, with Application to Learning from Label Proportions
本文提出了一种对多个样本量和标签噪声水平各异的二分类数据集进行学习的加权组合方法,通过基于样本量和噪声程度优化权重,实现了目前已知最紧的泛化误差界,并为从标签比例学习(LLP)提供了最全面的统计一致性保证。
We study binary classification in the setting where the learner is presented with multiple corrupted training samples, with possibly different sample sizes and degrees of corruption, and introduce an approach based on minimizing a weighted combination of corruption-corrected empirical risks. We establish a generalization error bound, and further show that the bound is optimized when the weights are certain interpretable and intuitive functions of the sample sizes and degrees of corruptions. We then apply this setting to the problem of learning with label proportions (LLP), and propose an algorithm that enjoys the most general statistical performance guarantees known for LLP. Experiments demonstrate the utility of our theory.
研究动机与目标
- 解决从多个独立污染的二分类数据集进行学习的挑战,这些数据集具有不同的样本量和污染水平。
- 构建一个统一框架,同时泛化单源标签噪声校正与从标签比例学习(LLP)的方法。
- 为基于核的预测器在多个污染源上训练时,建立分布无关的泛化误差界。
- 为弱监督下分类性能的普遍一致性提供理论保证。
- 将该框架应用于LLP,提供迄今为止最全面的统计分析,并引入可解释的、经优化的加权方案。
提出的方法
- 构建一个污染校正后经验风险的加权和,其中每个数据源的损失函数均根据其已知或估计的标签污染程度进行调整。
- 利用Rademacher复杂度推导泛化误差界,适用于Lipschitz损失函数和任意权重。
- 通过解析优化权重以最小化泛化误差界,得到一个与各源中正负类别比例差的平方成正比的闭式表达式。
- 通过将每个包建模为具有已知标签比例的污染数据源,将LLP问题转化为多源学习问题,从而将框架应用于LLP。
- 利用表示定理在再生核希尔伯特空间中表达解,从而实现基于核的学习并采用梯度下降进行优化。
- 根据理论预测实现最优包对配对与权重分配,剔除权重为零的包对(即比例平衡的包对)。
实验结果
研究问题
- RQ1如何在二分类任务中,最优地聚合来自多个样本量和污染水平各异的数据集的信息?
- RQ2对于多个污染源,理论上最优的加权方案是什么,能够最小化泛化误差?
- RQ3所提出的框架能否为从标签比例学习(LLP)提供强于现有方法的统计保证?
- RQ4该方法在弱监督下使用标签比例时,能否实现分类性能的普遍一致性?
- RQ5基于污染水平和样本量的理论权重优化,在经验上与现有LLP算法相比表现如何?
主要发现
- 所提方法实现了目前已知最紧的多污染源学习泛化误差界,该界通过Rademacher复杂度推导得出。
- 最优权重被解析推导为与各源中正负标签比例差的平方成正比,提供了一种可解释且直观的聚合规则。
- 该框架在分类性能度量上建立了普遍一致性,其保证强于以往的LLP方法。
- 实验结果表明,校正损失方法在20次实验中的16次里,于8个UCI数据集和多种包大小下,均优于InvCal和交替-∝ SVM的平衡准确率。
- 即使在标签比例不纯净的情况下,该方法仍保持强性能,避免了先前工作中的严格假设(如纯净包或有限特征空间)。
- 理论分析不仅适用于LLP,还可推广至一般特征依赖的标签噪声,为该设置提供了首个分布无关的泛化误差界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。