Skip to main content
QUICK REVIEW

[论文解读] SimpleDet: A Simple and Versatile Distributed Framework for Object Detection and Instance Recognition

Yuntao Chen, Chenxia Han|arXiv (Cornell University)|Mar 14, 2019
Advanced Neural Network Applications参考文献 17被引用 15
一句话总结

SimpleDet 是一个基于 MXNet 构建的轻量级、开源目标检测框架,可在消费级硬件上实现高效、可扩展的最先进检测模型训练。它通过优化参数通信、混合精度训练、跨 GPU 批归一化以及内存节省技术,在分布式训练中实现了近乎线性的扩展性能,使用 FP16 训练时可实现最高 2.0 倍的加速和 30% 的内存减少。

ABSTRACT

Object detection and instance recognition play a central role in many AI applications like autonomous driving, video surveillance and medical image analysis. However, training object detection models on large scale datasets remains computationally expensive and time consuming. This paper presents an efficient and open source object detection framework called SimpleDet which enables the training of state-of-the-art detection models on consumer grade hardware at large scale. SimpleDet supports up-to-date detection models with best practice. SimpleDet also supports distributed training with near linear scaling out of box. Codes, examples and documents of SimpleDet can be found at https://github.com/tusimple/simpledet .

研究动机与目标

  • 解决在消费级硬件上大规模目标检测的高计算成本和长时间训练问题。
  • 提供一个可高效扩展的分布式训练框架,且对基础设施要求最低。
  • 通过纯 Python 配置系统简化模型训练和超参数调优。
  • 原生支持高级训练特性,如混合精度训练、跨 GPU 批归一化和内存检查点技术。
  • 在极低硬件开销下实现高性能训练,包括 25Gb 以太网和消费级 GPU。

提出的方法

  • SimpleDet 使用 MXNet 作为其深度学习后端,支持基于参数服务器和全归约通信范式的高效分布式训练。
  • 通过使用 FP16 配合损失缩放实现混合精度训练,以保持收敛性并减少内存使用。
  • 集成跨 GPU 批归一化(CGBN),使最大小批量大小(最高达 256)的训练保持稳定,避免收敛失败。
  • 通过 FP16 训练、就地激活批归一化以及逐层内存检查点技术的组合,实现内存节省。
  • 框架采用纯 Python 配置系统,灵活管理模型和训练超参数。
  • 提供预构建的 Singularity 和 Docker 容器,以简化部署和实现可复现性。

实验结果

研究问题

  • RQ1一个分布式目标检测框架是否能在仅使用标准 25Gb 以太网的消费级硬件上实现近乎线性的扩展?
  • RQ2混合精度训练在不损失模型精度的前提下,是否能有效减少内存使用和训练时间?
  • RQ3跨 GPU 批归一化是否能实现大小批量大小下的稳定训练,且无收敛问题?
  • RQ4像检查点技术和就地操作这样的内存节省技术,能在多大程度上减少 GPU 内存消耗?
  • RQ5与 Detectron、MMDetection 和 Mask R-CNN Benchmark 等现有框架相比,SimpleDet 在训练速度和功能支持方面表现如何?

主要发现

  • SimpleDet 在仅使用消费级 25Gb 以太网的 4 节点 GPU 集群上实现了近乎线性的扩展效率,表现出极高的通信效率。
  • 与 FP32 训练相比,使用 FP16 的混合精度训练实现了 2.0 倍的加速和 30% 的 GPU 内存使用减少,且 mAP 性能保持不变。
  • 通过引入跨 GPU 批归一化,SimpleDet 在小批量大小为 256 的情况下成功训练检测器,实现了大规模训练下的稳定收敛。
  • 混合精度训练、就地批归一化和内存检查点技术的组合,将 GPU 内存使用减少高达 50%,且计算成本仅略有增加。
  • SimpleDet 在功能覆盖方面优于其他框架,原生支持所有主流模型(如 RetinaNet、Cascade R-CNN、TridentNet)以及分布式训练和混合精度训练等高级特性。
  • 在训练速度方面,SimpleDet 在使用 ResNet-50-C4 的 Faster R-CNN 上实现了每秒 37 张图像的推理速度,优于 Detectron 和 MMDetection,且与 Mask R-CNN Benchmark 相当或更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。