Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Multi-Label Learning with Incomplete Label Assignments

Xiangnan Kong, Zhaoming Wu|arXiv (Cornell University)|Jul 6, 2014
Text and Document Classification Technologies参考文献 11被引用 14
一句话总结

该论文提出MPU,一种可扩展的多标签学习方法,通过使用正样本-未标记样本随机梯度下降和堆叠模型,联合建模不完整的标签分配与标签相关性。该方法在大规模多标签数据集上实现了最先进性能,时间复杂度为线性,显著优于M3L和Well等基线方法,尤其在高缺失率下表现更优。

ABSTRACT

Multi-label learning deals with the classification problems where each instance can be assigned with multiple labels simultaneously. Conventional multi-label learning approaches mainly focus on exploiting label correlations. It is usually assumed, explicitly or implicitly, that the label sets for training instances are fully labeled without any missing labels. However, in many real-world multi-label datasets, the label assignments for training instances can be incomplete. Some ground-truth labels can be missed by the labeler from the label set. This problem is especially typical when the number instances is very large, and the labeling cost is very high, which makes it almost impossible to get a fully labeled training set. In this paper, we study the problem of large-scale multi-label learning with incomplete label assignments. We propose an approach, called MPU, based upon positive and unlabeled stochastic gradient descent and stacked models. Unlike prior works, our method can effectively and efficiently consider missing labels and label correlations simultaneously, and is very scalable, that has linear time complexities over the size of the data. Extensive experiments on two real-world multi-label datasets show that our MPU model consistently outperform other commonly-used baselines.

研究动机与目标

  • 解决由于标注成本高昂,导致训练样本存在缺失真实标签时的大规模多标签学习挑战。
  • 克服传统多标签方法将未标注标签视为负样本的局限性,该做法会降低性能。
  • 开发一种可扩展的解决方案,同时显式建模缺失标签与标签相关性。
  • 在样本数量和类别数量上均实现线性时间复杂度,以高效处理超大规模数据集。
  • 提升在具有不完整标注的真实世界多标签数据集上的分类性能。

提出的方法

  • MPU使用正样本-未标记样本(PU)随机梯度下降来处理缺失标签,将未标注标签视为潜在正样本。
  • 通过堆叠模型架构引入标签相关性,学习多个标签之间的依赖关系。
  • 将标签集合建模为概率输出,其中缺失标签不被假设为负样本,而是使用PU学习原则进行估计。
  • MPU采用线性时间优化策略,使其可扩展至具有高样本数和类别数的大规模数据集。
  • 堆叠模型框架支持多标签的联合预测,同时利用标签间的相关性。
  • 该方法通过交叉验证估计缺失标签率,并相应调整学习过程,以减少不完整标注带来的偏差。

实验结果

研究问题

  • RQ1当由于标注成本高昂导致训练样本存在不完整标签分配时,如何有效进行多标签学习?
  • RQ2在大规模多标签数据集中存在缺失标签的情况下,标签相关性能在多大程度上提升性能?
  • RQ3能否设计一种方法,在同时处理缺失标签与标签相关性的同时,保持线性时间复杂度?
  • RQ4在大规模真实世界数据集上,所提出方法与现有基线方法在准确率和可扩展性方面相比如何?
  • RQ5不同缺失率对具有不完整标签的多标签学习模型性能有何影响?

主要发现

  • MPU在小规模和大规模真实世界多标签数据集上均持续优于M3L和Well等基线方法,尤其在缺失率超过30%时表现更优。
  • 该方法在样本数量和类别数量上均实现线性时间复杂度,支持大规模数据集的可扩展性。
  • 实验表明,MPU通过显式建模缺失标签与标签相关性,显著提升了多标签分类性能。
  • 训练时间结果表明,MPU与M3L能良好扩展至大规模数据集,而Well等方法因$O(n^2)$复杂度变得不可行。
  • MPU的性能提升在高缺失率条件下最为显著,证实了其PU学习与相关性建模策略的有效性。
  • 当缺失率超过30%时,MPU优于M3L,表明其在处理不完整标签分配方面具有更强能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。