Skip to main content
QUICK REVIEW

[论文解读] Deep multi-class learning from label proportions

Gabriel Dulac-Arnold, Neil Zeghidour|arXiv (Cornell University)|May 30, 2019
Machine Learning and Data Classification参考文献 33被引用 13
一句话总结

该论文提出了一种深度学习框架,用于使用标签比例而非单个标签进行多类别图像分类,通过基于交叉熵和正则化最优传输的可微分损失函数进行端到端训练。该方法在CIFAR-10和CIFAR-100上表现出稳健性能,即使在每袋最多16个样本的情况下也表现良好,其中基于最优传输的损失显示出对大样本袋更强的鲁棒性。

ABSTRACT

We propose a learning algorithm capable of learning from label proportions instead of direct data labels. In this scenario, our data are arranged into various bags of a certain size, and only the proportions of each label within a given bag are known. This is a common situation in cases where per-data labeling is lengthy, but a more general label is easily accessible. Several approaches have been proposed to learn in this setting with linear models in the multiclass setting, or with nonlinear models in the binary classification setting. Here we investigate the more general nonlinear multiclass setting, and compare two differentiable loss functions to train end-to-end deep neural networks from bags with label proportions. We illustrate the relevance of our methods on an image classification benchmark, and demonstrate the possibility to learn accurate image classifiers from bags of images.

研究动机与目标

  • 解决当仅能获得每袋的标签比例而非单个样本标签时,训练深度神经网络的挑战。
  • 将现有LLP方法——此前仅限于线性模型或二分类任务——扩展到一般非线性多类别深度学习设置。
  • 开发并比较可微分损失函数,以在标签比例约束下实现深度网络的端到端训练。
  • 证明在医学影像或隐私保护数据等实际场景中,从聚合标签统计信息学习图像分类器的可行性与准确性。

提出的方法

  • 提出一种针对标签比例学习的可微分松弛交叉熵损失,使通过袋级别约束进行反向传播成为可能。
  • 引入一种新颖的正则化最优传输(ROT)损失,用于建模样本到类别的分配,同时尊重袋级别的标签比例。
  • 将优化问题表述为涉及代价矩阵、熵正则化和目标比例KL散度的鞍点问题。
  • 使用标准交叉熵松弛或ROT损失,对深度神经网络进行端到端训练,所有袋内样本共享特征表示。
  • 采用拉格朗日对偶形式推导出标签分配矩阵的闭式更新,实现可微分优化。
  • 在图像分类基准(CIFAR-10和CIFAR-100)上应用该方法,使用不同大小的袋进行评估,以检验对标签模糊性的鲁棒性。

实验结果

研究问题

  • RQ1当仅能获得每袋的标签比例时,能否在多类别设置中有效训练深度神经网络?
  • RQ2在性能和鲁棒性方面,可微分袋级别损失——特别是交叉熵松弛与正则化最优传输——如何比较?
  • RQ3在从标签比例学习时,袋大小对模型准确率有何影响?
  • RQ4在训练过程中联合估计单个样本标签是否能提升性能,优于标准的袋级别建模?
  • RQ5在CIFAR-10和CIFAR-100等复杂真实基准上,在标签比例约束下,模型表现如何?

主要发现

  • 使用实例级别交叉熵损失的基线方法在LLP设置下表现不佳,证实了袋级别正则化的必要性。
  • 基于正则化最优传输的ROT损失在所有情况下均表现优于或至少匹配交叉熵松弛,尤其在大袋(512和1024个样本)中表现出更强的鲁棒性。
  • 当袋大小超过16后,模型准确率急剧下降,在1024个样本时接近随机猜测水平,表明可靠学习存在实际限制。
  • 尽管理论复杂度较高,基于KL的简化损失性能几乎与更复杂的ROT损失相当,表明联合标签估计并不总能提升性能。
  • CIFAR-10与CIFAR-100之间的准确率-袋大小曲线极为相似,表明拐点更依赖于模型架构和训练设置,而非数据集难度。
  • 该方法成功从标签比例训练出高精度图像分类器,证明了其在医学影像等场景中的可行性,其中个体标注成本高昂或不可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。