Skip to main content
QUICK REVIEW

[论文解读] PFDet: 2nd Place Solution to Open Images Challenge 2018 Object Detection Track

Takuya Akiba, Tommi Kerola|arXiv (Cornell University)|Sep 4, 2018
Advanced Neural Network Applications参考文献 15被引用 15
一句话总结

PFDet 提出了一种可扩展的物体检测系统,使用 512 张 GPU 进行多节点批量归一化训练,在 2018 年 Open Images 物体检测挑战赛中获得第二名。该方法引入共现损失以缓解稀疏标注和专家模型微调罕见类别所带来的噪声标签问题,使部件类别和罕见类别的性能最高提升 9.2 AP。

ABSTRACT

We present a large-scale object detection system by team PFDet. Our system enables training with huge datasets using 512 GPUs, handles sparsely verified classes, and massive class imbalance. Using our method, we achieved 2nd place in the Google AI Open Images Object Detection Track 2018 on Kaggle.

研究动机与目标

  • 解决在 Open Images Dataset V4 上大规模训练物体检测器的挑战,该数据集包含 170 万张图像和 1200 万个边界框,存在极端的类别不平衡问题。
  • 克服 OID 中稀疏标注的问题,即未验证的类别未被标注,导致部件类别出现假阴性预测。
  • 缓解严重的类别不平衡问题——最常见类别(Person)出现在 80 万张以上图像中,而最罕见类别(Pressure Cooker)仅出现在 13 张图像中——同时不降低常见类别的性能。
  • 通过在 512 张 GPU 上实现稳定跨节点的批量归一化,实现高度可扩展的训练,缩短训练时间的同时保持模型准确率。

提出的方法

  • 采用两阶段 Faster R-CNN 框架,使用 SE-ResNeXt-101 和 SENet-154 作为骨干网络,结合特征金字塔网络(FPN)、金字塔空间池化(PSP),并将 FPN 尺度扩展至五个,以增强全局上下文理解。
  • 通过 ChainerMN 实现多节点批量归一化,使 512 张 GPU 上的批量大小达到 512,从而稳定训练,实现高效的大规模训练。
  • 引入共现损失机制,当主体类别存在且在空间上接近时,抑制部件类别的学习信号,从而减少因标注稀疏导致的假阴性。
  • 利用 OID 的语义层次结构构建类别间关系,识别主体-部件类别对,并仅对空间重叠的提议框应用共现损失。
  • 针对频率最低的 250 个类别(按频率排序)训练专家模型,分别进行微调,并与通用模型集成,以提升罕见类别检测性能,同时不损害常见类别的表现。
  • 采用 Sigmoid 交叉熵 损失进行多标签分类,使用余弦退火进行学习率调度,并在推理阶段采用非极大值加权抑制(NMW)以减少重复检测。

实验结果

研究问题

  • RQ1如何在 Open Images Dataset V4 上有效实现大规模训练物体检测器,该数据集的类别不平衡程度是 MS COCO 的 183 倍?
  • RQ2哪些技术可以缓解 OID 中稀疏标注带来的负面影响,即未验证类别未被标注,导致部件类别出现假阴性?
  • RQ3仅在罕见类别上训练的专家模型是否能提升检测性能,而不会降低常见类别的准确率?
  • RQ4共现损失在多大程度上减少了因假阴性预测导致的部件类别检测中的噪声监督?
  • RQ5多节点批量归一化如何实现 512 张 GPU 上批量大小为 512 的稳定训练,从而支持如此大规模数据集的训练?

主要发现

  • 最终集成模型在验证集上达到 74.07% 的 mAP,较公开排行榜上的冠军高出 1.17%,在私有排行榜上仅落后 0.03%。
  • 共现损失使 47 个受影响的部件类别的平均 AP 提升 9.2 个百分点,部分类别提升高达 34.3 个百分点(例如,Face 从 55.2 提升至 91.4)。
  • 在第 11 至 100 个最频繁类别的罕见类别上微调专家模型,使 mAP 从完整模型的 51.9% 提升至 65.6%,显著改善了罕见类别检测性能。
  • 在第 100 至 250 个类别的罕见类别上微调专家模型,使 mAP 从 70.5% 提升至 73.1%,但对更常见类别(第 251–350 名)的性能产生下降,表明模型范围存在权衡。
  • 采用共现损失和完整集成的模型达到 74.07% 的 mAP,比基线(60.0%)高出 14.07 个百分点,且每个架构和训练组件均带来增量性能提升。
  • 使用 512 张 GPU 和多节点批量归一化训练,实现了 83% 的单节点(8-GPU)训练速度提升效率,证明了高度可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。