[论文解读] Adaptive Class Suppression Loss for Long-Tail Object Detection
本文提出自适应类别抑制损失(ACSL),一种无统计量、自适应的损失函数,通过根据学习状态动态调整每类的负梯度抑制,缓解长尾目标检测中的类别不平衡问题。ACSL无需手动划分头部/尾部类别,提升了罕见类别及语义相似类别的判别能力,并在使用ResNet50-FPN的LVIS和Open Images数据集上分别取得5.18%和5.2%的mAP提升,达到当前最先进性能。
To address the problem of long-tail distribution for the large vocabulary object detection task, existing methods usually divide the whole categories into several groups and treat each group with different strategies. These methods bring the following two problems. One is the training inconsistency between adjacent categories of similar sizes, and the other is that the learned model is lack of discrimination for tail categories which are semantically similar to some of the head categories. In this paper, we devise a novel Adaptive Class Suppression Loss (ACSL) to effectively tackle the above problems and improve the detection performance of tail categories. Specifically, we introduce a statistic-free perspective to analyze the long-tail distribution, breaking the limitation of manual grouping. According to this perspective, our ACSL adjusts the suppression gradients for each sample of each class adaptively, ensuring the training consistency and boosting the discrimination for rare categories. Extensive experiments on long-tail datasets LVIS and Open Images show that the our ACSL achieves 5.18% and 5.2% improvements with ResNet50-FPN, and sets a new state of the art. Code and models are available at https://github.com/CASIA-IVA-Lab/ACSL.
研究动机与目标
- 解决现有长尾检测方法依赖于基于实例频率的人工类别分组所带来的局限性。
- 缓解实例数量相近但分组不同的相邻类别之间的训练不一致性。
- 提升与头部类别视觉相似的尾部类别之间的判别特征学习能力。
- 通过引入无统计量、自适应的训练策略,消除对数据重采样或启发式超参数的依赖。
- 在不损害头部类别性能的前提下,实现所有类别(尤其是罕见类别)的一致性能提升。
提出的方法
- 从无统计量的角度看待长尾分布,将所有类别视为潜在的罕见类别,以避免人为划分头部/尾部类别。
- 设计一种自适应梯度抑制机制,根据每类当前的学习状态动态调整其负梯度流动。
- 为每类引入可学习的抑制因子,用于缩放负梯度,防止对尾部分类器的过度抑制。
- 将损失函数应用于标准的Faster R-CNN或RetinaNet风格检测头中,与现有架构无缝集成。
- 使用单一超参数 ξ 控制整体抑制强度,通过在验证集上经验调优确定。
- 采用标准优化方法进行端到端训练,使模型能够自动平衡所有类别之间的学习动态。
实验结果
研究问题
- RQ1能否设计一种损失函数,以消除长尾检测中对人工类别分组的需求?
- RQ2当实例频率相近的类别被分配到不同组别时,如何减少其训练不一致性?
- RQ3能否在视觉相似但频率不同的类别之间保持或增强其判别能力?
- RQ4在长尾设定下,基于学习状态感知的自适应抑制机制是否优于固定或基于分组的梯度处理方法?
- RQ5无统计量损失是否能在不进行数据重加权或重采样的前提下,实现头部和尾部类别的一致性能提升?
主要发现
- 在使用ResNet50-FPN的LVIS数据集上,ACSL相较于基线模型实现5.18%的mAP提升,创下新的最先进纪录。
- 在Open Images数据集上,ACSL在使用ResNet50-FPN时使mAP提升5.2%,并使用ResNet152-FPN达到62.8%的mAP。
- 对于罕见类别如“口罩”和“粉底”,ACSL分别实现高达63.1%和63.1%的AP提升,展现出强大的罕见类别泛化能力。
- 采用多尺度测试时,最佳模型在LVIS上达到29.47%的mAP,显著优于Equalization Loss和BAGS。
- 在Open Images上,ACSL超越先前方法如Class Aware Sampling和Equalization Loss,实现61.70%的AP,优于Equalization Loss的57.83%。
- 该方法在所有类别上均保持强劲性能,头部和尾部类别均实现一致提升,表明训练一致性与判别能力得到显著改善。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。