Skip to main content
QUICK REVIEW

[论文解读] SGNet: A Super-class Guided Network for Image Classification and Object Detection

Kaidong Li, Nina Y. Wang|arXiv (Cornell University)|Apr 26, 2021
Advanced Neural Network Applications参考文献 35被引用 5
一句话总结

SGNet 提出了一种超级类别引导的网络,通过在超级类别和细粒度类别上进行双分支训练,整合层次化语义知识,从而提升图像分类和目标检测性能。通过利用超级类别分支(SCB)对细粒度类别分支(FCB)进行高层语义聚类引导,SGNet 实现了稳定的性能提升——在 MS COCO 数据集上,IoU=0.50 时平均精度(AP)最高提升 1.1%,且计算开销极低。

ABSTRACT

Most classification models treat different object classes in parallel and the misclassifications between any two classes are treated equally. In contrast, human beings can exploit high-level information in making a prediction of an unknown object. Inspired by this observation, the paper proposes a super-class guided network (SGNet) to integrate the high-level semantic information into the network so as to increase its performance in inference. SGNet takes two-level class annotations that contain both super-class and finer class labels. The super-classes are higher-level semantic categories that consist of a certain amount of finer classes. A super-class branch (SCB), trained on super-class labels, is introduced to guide finer class prediction. At the inference time, we adopt two different strategies: Two-step inference (TSI) and direct inference (DI). TSI first predicts the super-class and then makes predictions of the corresponding finer class. On the other hand, DI directly generates predictions from the finer class branch (FCB). Extensive experiments have been performed on CIFAR-100 and MS COCO datasets. The experimental results validate the proposed approach and demonstrate its superior performance on image classification and object detection.

研究动机与目标

  • 为解决标准卷积神经网络(CNN)对所有类别一视同仁、未利用语义层次结构的问题。
  • 通过在训练过程中引入来自超级类别的高层语义知识,提升模型的泛化能力与鲁棒性。
  • 通过使用更粗粒度、语义上更有意义的类别来引导细粒度类别预测,实现更优的特征学习。
  • 设计一种即插即用的架构,与现有分类与检测模型兼容。
  • 在包括 CIFAR-100 和 MS COCO 在内的多样化基准上,验证超级类别引导的有效性。

提出的方法

  • 提出双分支架构:一个在高层语义类别上训练的超级类别分支(SCB),以及一个用于详细分类的细粒度类别分支(FCB)。
  • 在 SCB 和 FCB 之间共享主干特征提取器,同时为每个分支保留独立的分类头。
  • 采用两阶段训练策略,联合优化 SCB 和 FCB,使用交叉熵损失,并对 SCB 中的误分类施加更高的惩罚。
  • 应用两种推理策略:两步推理(TSI)先预测超级类别,再预测细粒度类别;直接推理(DI)则直接从 FCB 输出细粒度类别预测结果。
  • 通过扩展分类头以输出 94 个类别(12 个超级类别 + 81 个细粒度类别),将 Faster R-CNN 框架适配为支持 SCB 和 FCB 的独立损失组件。
  • 将损失值归一化至 [0,1] 以实现稳定训练,并采用学习率衰减策略,初始学习率为 10⁻²,每 5 个周期衰减一次。

实验结果

研究问题

  • RQ1将超级类别语义信息整合是否能提升图像分类与目标检测模型的泛化能力与鲁棒性?
  • RQ2使用高层语义特征引导细粒度类别预测,是否能优于标准的并行分类方法?
  • RQ3采用共享主干与双重监督的双分支架构,如何影响收敛速度与推理精度?
  • RQ4在小 IoU 阈值与大目标检测任务中,超级类别引导能带来多大程度的性能提升?
  • RQ5所提出的方法能否在极少架构改动的前提下,有效应用于 VGG-16 和 Faster R-CNN 等现有模型?

主要发现

  • 与原始 VGG-16 相比,SGNet 在 MS COCO 上将平均精度(AP)提升了 0.6%,在 IoU=0.50 时提升达 1.1%。
  • 在大目标上表现更优,大目标的 AP 提升了 0.9%(从 40.3% 提升至 41.2%)。
  • SGNet 的训练损失收敛速度明显快于标准 VGG-16,尤其在训练初期阶段。
  • SGNet 的模型大小与推理时间(43.4ms)与原始 VGG-16(43.0ms)几乎完全一致,表明其推理开销极低。
  • SGNet 在 MS COCO 上达到 29.2 的 AP,优于基线模型 VGG-16(28.6 AP),且在所有 AP 指标上均保持一致的性能增益。
  • 该方法在图像分类(CIFAR-100)与目标检测(MS COCO)任务中均表现有效,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。