[论文解读] Learning with Hierarchical Complement Objective
本文提出层级互补目标训练(HCOT),一种新颖的训练目标,通过以分层方式联合最大化真实类别概率并中和错误类别,利用视觉任务中的标签层次结构。HCOT在CIFAR-100、ImageNet-2012和PASCAL-Context上均优于交叉熵损失和COT,实现了图像分类与语义分割任务的最先进性能。
Label hierarchies widely exist in many vision-related problems, ranging from explicit label hierarchies existed in image classification to latent label hierarchies existed in semantic segmentation. Nevertheless, state-of-the-art methods often deploy cross-entropy loss that implicitly assumes class labels to be exclusive and thus independence from each other. Motivated by the fact that classes from the same parental category usually share certain similarity, we design a new training diagram called Hierarchical Complement Objective Training (HCOT) that leverages the information from label hierarchy. HCOT maximizes the probability of the ground truth class, and at the same time, neutralizes the probabilities of rest of the classes in a hierarchical fashion, making the model take advantage of the label hierarchy explicitly. The proposed HCOT is evaluated on both image classification and semantic segmentation tasks. Experimental results confirm that HCOT outperforms state-of-the-art models in CIFAR-100, ImageNet-2012, and PASCAL-Context. The study further demonstrates that HCOT can be applied on tasks with latent label hierarchies, which is a common characteristic in many machine learning tasks.
研究动机与目标
- 为解决交叉熵损失在建模层次化标签结构时的局限性,后者假设类别之间相互独立。
- 通过在训练过程中显式引入标签层次结构,提升模型泛化能力,尤其适用于具有显式或潜在层次结构的任务。
- 设计一种训练目标,根据错误类别与真实类别在层次结构中的距离施加不同惩罚。
- 在多种视觉任务中验证HCOT的有效性,包括图像分类与语义分割。
- 证明HCOT可应用于具有潜在标签层次结构的任务(如语义分割),而无需提供显式的层次标注。
提出的方法
- HCOT引入一种新型互补目标——分层互补熵,分别在细粒度类别和粗粒度类别上应用互补学习。
- 该方法在最大化真实类别预测概率的同时,以分层方式中和错误类别的概率。
- 与真实类别共享相同粗粒度类别的错误类别所受惩罚较小,而位于标签层次结构不同分支的类别则受更大惩罚。
- 训练目标结合主干交叉熵损失与分层互补熵损失,实现联合优化,计算开销极低。
- 该方法可端到端应用于分类与分割模型,无需任何网络架构修改。
- 在CIFAR-100、ImageNet-2012和PASCAL-Context上,使用标准指标(如top-1准确率、mIoU和像素准确率)进行评估。
实验结果
研究问题
- RQ1一种显式建模标签层次结构的训练目标,是否能提升具有层次标签的图像分类任务性能?
- RQ2在标准基准上,HCOT相较于交叉熵损失和COT在准确率与鲁棒性方面表现如何?
- RQ3HCOT能否有效利用语义分割等任务中无显式层次标注的潜在标签层次结构?
- RQ4基于与真实类别在层次结构中距离的差异化惩罚机制,是否能带来更好的泛化能力与更结构化的预测结果?
- RQ5HCOT是否可与最先进模型及训练流程兼容,而无需进行网络架构修改?
主要发现
- 在CIFAR-100上,HCOT使用PreAct ResNet-18实现88.4%的top-1准确率,优于交叉熵(87.1%)与COT(87.8%)。
- 在ImageNet-2012上,HCOT使用ResNet-50相比交叉熵提升0.6% top-1准确率,相比COT提升0.4%。
- 在PASCAL-Context上,HCOT使用EncNet实现49.86%的mIoU,使用EncNet+JPU实现51.35%的mIoU,均优于交叉熵与COT。
- 可视化结果表明,HCOT生成的分割结果更少碎片化,且噪声伪影更少,优于交叉熵与COT。
- HCOT在多种主干网络架构与训练策略下均保持性能增益,表明其具有广泛适用性。
- HCOT证明,在标签空间中建模层次关系可提升预测置信度,并使预测更贴近真实数据分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。