[论文解读] YOLOX-PAI: An Improved YOLOX, Stronger and Faster than YOLOv6
YOLOX-PAI 是 YOLOX 的增强版本,在单张 V100 GPU 上实现 1.0ms 内推理速度的同时,在 COCO 上达到 42.8 mAP 的最先进目标检测性能。它通过 PAI-Blade 加速,并结合统一的 EasyCV 预测器 API 实现端到端推理优化,整合了主干网络(RepVGG)、特征金字塔(ASFF_Sim 和 GSConv)以及检测头(TOOD-Head)的改进。
We develop an all-in-one computer vision toolbox named EasyCV to facilitate the use of various SOTA computer vision methods. Recently, we add YOLOX-PAI, an improved version of YOLOX, into EasyCV. We conduct ablation studies to investigate the influence of some detection methods on YOLOX. We also provide an easy use for PAI-Blade which is used to accelerate the inference process based on BladeDISC and TensorRT. Finally, we receive 42.8 mAP on COCO dateset within 1.0 ms on a single NVIDIA V100 GPU, which is a bit faster than YOLOv6. A simple but efficient predictor api is also designed in EasyCV to conduct end2end object detection. Codes and models are now available at: https://github.com/alibaba/EasyCV.
研究动机与目标
- 提升 YOLOX 的精度与推理速度,以支持实时目标检测。
- 将最先进检测组件(RepVGG、GSConv、ASFF_Sim、TOOD-Head)整合至统一且用户友好的框架中。
- 通过 PAI-Blade 和 EasyCV 中灵活的预测器 API 实现端到端推理加速。
- 为用户提供简单易用的一体化解决方案,用于部署高性能目标检测器。
- 在 40–50 mAP 范围内实现最先进性能,并在 V100 上实现 1ms 以下的推理延迟。
提出的方法
- 采用基于 RepVGG 的主干网络,相比 CSPNet 在推理速度与精度上均有提升。
- 提出 ASFF_Sim,一种轻量级特征融合方法,使用切片与均值操作替代卷积层。
- 采用 GSConv,一种参数高效的卷积模块,可在颈部结构中显著降低 FLOPs 且精度损失极小。
- 通过 TOOD-Head 改进 YOLOX 检测头,利用共享的跨特征图与任务特定注意力机制,提升检测对齐能力。
- 集成 PAI-Blade 实现自动模型优化,包括 TensorRT 与基于 BladeDISC 的推理加速。
- 开发灵活的 EasyCV 预测器 API,支持 JIT 编译的预处理、优化的 NMS 以及模型导出,实现端到端推理优化。
实验结果
研究问题
- RQ1RepVGG、ASFF_Sim 和 GSConv 对 YOLOX 的精度与推理速度分别产生何种影响?
- RQ2TOOD-Head 在与不同主干网络和颈部结构组合时,能否提升 YOLOX 的性能?
- RQ3PAI-Blade 与 EasyCV 预测器 API 在多大程度上可降低端到端推理延迟?
- RQ4在 1ms 推理延迟下,YOLOX-PAI 与 YOLOv6 在 mAP 和速度上的表现如何对比?
- RQ5像 EasyCV 这类统一且面向初学者的工具包,能否在极少配置下有效支持高性能目标检测?
主要发现
- YOLOX-PAI 在单张 V100 GPU 上实现 1.0ms 推理延迟时,COCO 上达到 42.8 mAP,精度与速度均优于 YOLOv6。
- 采用基于 RepVGG 的主干网络使 mAP 提升 0.2–0.3 个百分点,且速度损失可忽略。
- ASFF_Sim 在仅增加少量 FLOPs 与参数量的前提下实现高效特征融合,尽管推理延迟高于原始 ASFF。
- GSConv 在颈部结构中使 FLOPs 降低 3%,mAP 提升 0.3,展现出在高通道特征图中的高效性。
- TOOD-Head 在堆叠 5 层跨特征图卷积后达到 44.7 mAP,体现出精度与速度之间的权衡。
- 结合 PAI-Blade 与 JIT 预处理的端到端推理将延迟从原始的 24.58ms 降低至 4.53ms,实现 251% 的加速,适用于 YOLOX-s 模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。