Skip to main content
QUICK REVIEW

[论文解读] Unbiased Loss Functions for Extreme Classification With Missing Labels

Erik Schultheis, Mohammadreza Qaraei|arXiv (Cornell University)|Jul 1, 2020
Text and Document Classification Technologies参考文献 37被引用 4
一句话总结

本文提出了用于极端多标签分类(XMC)的无偏损失函数,以纠正缺失标签和长尾标签不平衡问题。通过为常见损失函数(如平方合页损失和二元交叉熵损失)推导出特定于标签的加权因子,该方法在保持标准指标性能的同时,显著提升了对尾部标签的预测准确性,在基准数据集上实现了最高达20%的性能提升。

ABSTRACT

The goal in extreme multi-label classification (XMC) is to tag an instance with a small subset of relevant labels from an extremely large set of possible labels. In addition to the computational burden arising from large number of training instances, features and labels, problems in XMC are faced with two statistical challenges, (i) large number of 'tail-labels' -- those which occur very infrequently, and (ii) missing labels as it is virtually impossible to manually assign every relevant label to an instance. In this work, we derive an unbiased estimator for general formulation of loss functions which decompose over labels, and then infer the forms for commonly used loss functions such as hinge- and squared-hinge-loss and binary cross-entropy loss. We show that the derived unbiased estimators, in the form of appropriate weighting factors, can be easily incorporated in state-of-the-art algorithms for extreme classification, thereby scaling to datasets with hundreds of thousand labels. However, empirically, we find a slightly altered version that gives more relative weight to tail labels to perform even better. We suspect is due to the label imbalance in the dataset, which is not explicitly addressed by our theoretically derived estimator. Minimizing the proposed loss functions leads to significant improvement over existing methods (up to 20% in some cases) on benchmark datasets in XMC.

研究动机与目标

  • 解决极端多标签分类(XMC)中的统计挑战,包括长尾标签分布和训练数据中缺失标签的问题。
  • 为可分解为单个标签的损失函数(如合页损失、平方合页损失和二元交叉熵损失)推导理论上无偏的估计器。
  • 提出一种实用方法,将这些无偏估计器整合到最先进的XMC算法中,同时保持计算效率。
  • 在保持标准指标性能的同时,提升对尾部标签的预测性能——这些标签常因数据稀缺和标签缺失而被低估。

提出的方法

  • 通过使用倾向性得分建模缺失标签机制,推导出一般性标签可分解损失函数的无偏估计器,假设在给定观测特征的条件下,缺失性与真实标签条件独立。
  • 使用逆倾向性得分将原始损失函数转换为加权形式,以纠正缺失标签带来的偏差,确保在观测数据上的期望损失与真实期望损失一致。
  • 将推导出的加权方案应用于平方合页损失和二元交叉熵损失,这两类损失在基于线性SVM和逻辑回归的XMC模型中被广泛使用。
  • 引入一种改进的加权方案,增加对尾部标签的相对权重,尽管该理论估计器未显式建模标签不平衡,但实证结果表明其性能更优。
  • 将加权损失集成到一对多线性SVM框架中,支持使用二阶优化方法实现高效训练。
  • 使用L2正则化稳定训练过程并提升泛化能力,尤其在XMC中常见的高维稀疏设置下表现更佳。

实验结果

研究问题

  • RQ1当标签随机缺失时,能否为极端多标签分类中常用损失函数推导出无偏估计器?
  • RQ2在具有长尾标签分布的真实世界XMC数据集上,理论上推导出的无偏损失函数在实际应用中表现如何?
  • RQ3将基于倾向性模型推导出的特定于标签的加权因子引入模型,是否能相比标准基线方法提升尾部标签的预测性能?
  • RQ4所提出的方法是否能在显著提升尾部标签检测能力的同时,保持或改善标准指标(如精确率和nDCG)的性能?
  • RQ5为何一种稍作修改的加权方案——给予尾部标签更高权重——在实践中优于理论上无偏的估计器?

主要发现

  • 与现有最先进方法相比,所提方法在基准XMC数据集上实现了最高达20%的相对性能提升,尤其在尾部标签上表现显著。
  • 将无偏损失与特定于标签的权重整合进一对多线性SVM框架后,显著提升了尾部标签预测性能,同时未降低头部标签的性能。
  • 该方法优于ProXML(一种专为尾部标签检测设计的算法),且由于兼容二阶优化,速度接近快两个数量级。
  • 实证结果表明,通过增加尾部标签相对权重的改进加权方案,性能优于理论无偏估计器,可能是因为理论推导未充分考虑标签不平衡问题。
  • 该方法在标准指标(如精确率和nDCG)上保持了具有竞争力的性能,表明尾部标签性能的提升并未以整体准确率为代价。
  • 所推导的无偏估计器适用于广泛可分解为标签的损失函数,包括合页损失、平方合页损失和二元交叉熵损失,因此在XMC中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。