Skip to main content
QUICK REVIEW

[论文解读] Simple and Robust Loss Design for Multi-Label Learning with Missing Labels

Youcai Zhang, Yuhao Cheng|arXiv (Cornell University)|Dec 13, 2021
Text and Document Classification Technologies被引用 15
一句话总结

本文提出两种简单但有效的损失函数——Hill损失和自步损失修正(SPLC),在无需复杂架构或训练方案的前提下,提升缺失标签下的多标签学习性能。通过利用模型预测概率早期识别错误的负样本,该方法对问题负样本进行降权(Hill损失)或迭代修正缺失标签(SPLC),在多个基准测试中取得新的最先进性能。

ABSTRACT

Multi-label learning in the presence of missing labels (MLML) is a challenging problem. Existing methods mainly focus on the design of network structures or training schemes, which increase the complexity of implementation. This work seeks to fulfill the potential of loss function in MLML without increasing the procedure and complexity. Toward this end, we propose two simple yet effective methods via robust loss design based on an observation that a model can identify missing labels during training with a high precision. The first is a novel robust loss for negatives, namely the Hill loss, which re-weights negatives in the shape of a hill to alleviate the effect of false negatives. The second is a self-paced loss correction (SPLC) method, which uses a loss derived from the maximum likelihood criterion under an approximate distribution of missing labels. Comprehensive experiments on a vast range of multi-label image classification datasets demonstrate that our methods can remarkably boost the performance of MLML and achieve new state-of-the-art loss functions in MLML.

研究动机与目标

  • 为解决多标签学习中缺失标签(MLML)的问题,即不完整标注导致的错误负样本使模型性能下降。
  • 简化现有依赖复杂网络架构或训练流程的MLML方法。
  • 探究仅通过鲁棒损失设计是否可在不修改网络架构或训练方案的前提下显著提升MLML性能。
  • 探索是否可利用模型预测结果在训练早期高精度识别缺失标签。
  • 证明在此背景下,对正样本进行半难样本挖掘比硬样本挖掘更有效。

提出的方法

  • 提出Hill损失,一种基于重加权MSE的损失函数,对容易样本和错误负样本赋予较低权重,对半难负样本赋予较高权重,使训练对错误负样本更具鲁棒性。
  • 提出自步损失修正(SPLC),基于缺失标签近似分布下的最大似然损失,利用模型预测结果逐步修正错误负样本。
  • 在早期训练阶段使用高置信度阈值(≥0.6)对模型预测概率进行处理,以高精度识别潜在的缺失标签(错误负样本)。
  • 通过引入边缘超参数$m$对Focal损失进行改进,强调半难正样本而非硬正样本,称为Focal边缘损失。
  • 在固定早期训练阶段(第1个epoch后)应用SPLC,因性能对第2至第5个epoch之间的具体时间点不敏感。
  • 在多种主干网络(MobileNetV3、ResNet101、Swin-T)上应用该方法,以验证其泛化性与鲁棒性。

实验结果

研究问题

  • RQ1仅通过简单损失函数设计是否可在缺失标签的多标签学习中实现最先进性能?
  • RQ2即使在训练初期,模型预测概率是否能可靠地以高精度识别错误负样本(缺失标签)?
  • RQ3通过山形函数对负样本进行重加权(Hill损失)是否比标准交叉熵损失或Focal损失在处理错误负样本方面更有效?
  • RQ4基于模型预测结果对缺失标签进行自步修正,是否可在不增加额外训练或网络组件的前提下提升性能?
  • RQ5在缺失标签的多标签学习背景下,对正样本进行半难样本挖掘是否比硬样本挖掘更有效?

主要发现

  • Hill损失在所有测试主干网络上均优于标准BCE、Focal损失和ASL,在MobileNetV3上于COCO-40%标签下达到71.03 mAP,优于BCE的68.45 mAP。
  • 当$m=1$时,Focal边缘损失在COCO-40%标签下达到75.15 mAP,优于Focal损失(73.57)和ASL(69.65)的相同设置。
  • SPLC在阈值0.6下于COCO-40%标签下达到75.69 mAP,显著优于BCE(68.45)和WAN(69.27)。
  • Focal边缘损失与SPLC结合在ResNet101上达到77.20 mAP,在Swin-T上达到78.19 mAP,创下COCO-40%的新SOTA。
  • 该方法在多种主干网络上均表现鲁棒,MobileNetV3、ResNet101和Swin-T上均实现一致性能提升,表明其超越特定架构的泛化能力。
  • 阈值$\tau=0.6$在错误负样本识别中实现精度与召回率的最佳平衡,训练集错误率低于5%,且在不同早期训练阶段(第2至第5个epoch)性能稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。