Skip to main content
QUICK REVIEW

[论文解读] Learning from Label Proportions with Consistency Regularization

Kuen-Han Tsai, Hsuan-Tien Lin|arXiv (Cornell University)|Oct 29, 2019
Machine Learning and Data Classification参考文献 36被引用 7
一句话总结

本文提出了一种用于从标签比例(LLP)进行多分类学习的一致性正则化方法,利用未标记数据提升决策边界的泛化能力。通过结合袋级别比例损失与实例级别预测一致性,该方法在SVHN、CIFAR10和CIFAR100上实现了最先进性能,即使在非均匀袋生成和无标注验证数据的情况下亦然。

ABSTRACT

The problem of learning from label proportions (LLP) involves training classifiers with weak labels on bags of instances, rather than strong labels on individual instances. The weak labels only contain the label proportion of each bag. The LLP problem is important for many practical applications that only allow label proportions to be collected because of data privacy or annotation cost, and has recently received lots of research attention. Most existing works focus on extending supervised learning models to solve the LLP problem, but the weak learning nature makes it hard to further improve LLP performance with a supervised angle. In this paper, we take a different angle from semi-supervised learning. In particular, we propose a novel model inspired by consistency regularization, a popular concept in semi-supervised learning that encourages the model to produce a decision boundary that better describes the data manifold. With the introduction of consistency regularization, we further extend our study to non-uniform bag-generation and validation-based parameter-selection procedures that better match practical needs. Experiments not only justify that LLP with consistency regularization achieves superior performance, but also demonstrate the practical usability of the proposed procedures.

研究动机与目标

  • 解决仅能获得每袋中标签比例的分类器训练挑战,这是在隐私敏感或标注成本较高的场景中常见的约束。
  • 克服现有LLP方法依赖监督学习且在弱监督下表现受限的局限性。
  • 将通常用于半生学习的一致性正则化引入LLP,通过鼓励扰动输入上的平滑预测来提升模型泛化能力。
  • 提出一种仅使用比例标签的实用超参数选择方法,无需依赖标注验证集。
  • 提出一种基于K-means的非均匀袋生成方法,其数据分组模式比随机分组更贴近真实世界中的数据聚集模式。

提出的方法

  • 引入联合损失函数,包含袋级别的比例损失和实例级别的预测一致性损失,要求同一输入的扰动视图预测保持一致。
  • 通过扰动输入特征(如通过随机增强)并最小化扰动间预测方差,将一致性正则化应用于LLP。
  • 采用基于K-means聚类的袋生成方法,根据特征相似性对实例进行分组,模拟按区域、年龄或职业等实际因素分组的数据模式。
  • 提出一种基于预测与真实标签比例之间差值的袋级别验证指标——硬$L^1$误差,用于在无实例标签的情况下指导超参数调优。
  • 使用联合损失训练深度神经网络,实现端到端学习,并在弱监督下获得强泛化能力。
  • 通过在袋和实例两个层级对齐预测,将标准的一致性训练框架(如一致性正则化)适配到LLP设置中。

实验结果

研究问题

  • RQ1一致性正则化(一种半生学习技术)能否有效适配到多分类从标签比例(LLP)学习问题中?
  • RQ2与现有监督或伪标签方法相比,引入一致性正则化是否能提升LLP中的泛化能力和性能?
  • RQ3非均匀袋生成(如K-means聚类)对实际LLP应用中的模型性能和真实性有何影响?
  • RQ4仅基于标签比例的袋级别验证指标能否可靠地指导超参数选择,而无需访问实例级别标签?
  • RQ5所提出方法在现实数据分组模式和有限监督条件下是否仍能保持优异性能?

主要发现

  • 所提一致性正则化方法在多分类LLP基准上实现了最先进性能,在SVHN、CIFAR10和CIFAR100上均优于现有方法。
  • 该方法通过预测一致性学习到更贴近数据流形的决策边界,显著提升了分类准确率。
  • 基于K-means的袋生成方法相比均匀随机分组产生了更真实且更具挑战性的设置,更贴近真实世界的数据分组模式。
  • 所提出的袋级别硬$L^1$误差指标与测试分类误差具有强相关性,可在无标注验证数据的情况下有效指导超参数调优。
  • 实验表明,一致性正则化可缓解伪标签方法中常见的误差放大问题,带来更鲁棒的模型更新。
  • 该方法在不同数据集和袋生成策略下均保持卓越性能,证实了其实际应用价值和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。