Skip to main content
QUICK REVIEW

[论文解读] Learning from Label Proportions: A Mutual Contamination Framework

Clayton Scott, Jianxin Zhang|arXiv (Cornell University)|Jun 12, 2020
Machine Learning and Data Classification参考文献 26被引用 5
一句话总结

本文提出了一种用于从标签比例学习(LLP)的互污染模型(MCM)框架,建立了理论上合理、一致的训练准则,确保在平衡错误率(BER)意义上的普遍一致性。通过将袋级别的标签比例建模为污染混合物,该方法在非独立同分布(non-i.i.d.)采样下实现了无偏的经验风险最小化和泛化误差界,克服了先前方法缺乏理论依据或在不纯袋情况下失效的局限性。

ABSTRACT

Learning from label proportions (LLP) is a weakly supervised setting for classification in which unlabeled training instances are grouped into bags, and each bag is annotated with the proportion of each class occurring in that bag. Prior work on LLP has yet to establish a consistent learning procedure, nor does there exist a theoretically justified, general purpose training criterion. In this work we address these two issues by posing LLP in terms of mutual contamination models (MCMs), which have recently been applied successfully to study various other weak supervision settings. In the process, we establish several novel technical results for MCMs, including unbiased losses and generalization error bounds under non-iid sampling plans. We also point out the limitations of a common experimental setting for LLP, and propose a new one based on our MCM framework.

研究动机与目标

  • 为解决从标签比例学习(LLP)中缺乏一致且理论上有依据的训练准则的问题,LLP是一种弱监督分类设置,其中实例袋仅以类别比例进行标注。
  • 建立一种适用于LLP的一般性经验目标,该目标在平衡错误率(BER)意义上具有普遍一致性,克服了现有方法(如经验比例风险EPR和组合目标)的局限性。
  • 基于互污染模型(MCM)构建统计框架,该框架自然地建模标签比例数据,并支持在非独立同分布袋生成条件下的泛化误差分析。
  • 识别并纠正先前LLP实验设置中的根本性缺陷,提出一种基于MCM框架的新评估协议。
  • 在广泛的采样假设下,提供新的理论结果,包括无偏损失和泛化误差界。

提出的方法

  • 将LLP形式化为互污染模型(MCM),其中每个袋的标签比例源自类别条件特征分布的混合,从而实现原则性的统计建模。
  • 基于MCM推导出经验风险最小化准则,使用在MCM假设下无偏的损失函数,并确保与BER的一致性。
  • 针对两种不同的袋生成模型(一种为i.i.d.袋,另一种为非i.i.i.d.采样)建立泛化误差界,使用度量熵和覆盖数论证。
  • 提出一种基于MCM的新实验设置,避免了因假设纯袋或近似纯袋而引入的偏差,从而实现方法间更公平的比较。
  • 将MCM框架应用于证明所提出的估计器在温和正则性条件下具有普遍一致性,包括袋大小增长和袋数增加的情形。
  • 使用带正则化(如Tikhonov)的核方法以确保稳定性和收敛性,通过经验过程理论推导出所学函数范数的界。

实验结果

研究问题

  • RQ1能否为从标签比例学习(LLP)开发一种与袋纯度无关的理论一致的训练准则?
  • RQ2互污染模型(MCM)框架是否支持在非独立同分布袋采样方案下的泛化误差界?
  • RQ3如何改进现有的LLP实验协议,以避免过度依赖纯袋或近似纯袋所带来的偏差?
  • RQ4基于MCM的所提经验风险最小化方法是否在平衡错误率(BER)意义上具有普遍一致性?
  • RQ5MCM框架能否统一并改进现有LLP方法,如EPR最小化和组合优化?

主要发现

  • 所提出的基于MCM的经验风险最小化准则在平衡错误率(BER)意义上具有普遍一致性,即使在袋不纯的情况下也成立,从而解决了LLP中的一个关键理论缺口。
  • 在核和标签比例采样满足温和条件的前提下,为两种袋生成模型(一种为i.i.i.d.袋,另一种为非i.i.i.d.采样)建立了泛化误差界。
  • 该框架证明了当袋数和实例数增长时,经验风险估计器以概率收敛于真实风险,条件为N/K → ∞ 且 λ → 0,同时满足 λ(N/K)/log(N/K) → ∞。
  • 本文指出,先前依赖于纯袋或近似纯袋的实验设置存在根本性缺陷,并提出一种基于MCM的新评估协议,避免了此类偏差。
  • 提供了一个反例,表明当袋不纯时EPR最小化可能失效,凸显了现有方法的局限性,以及对理论上有依据的替代方法的迫切需求。
  • 理论分析证实,所提方法即使在具有挑战性的采样环境下(如袋数相对于实例数呈次线性增长)仍能实现一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。