[论文解读] Workshop on Autonomous Driving at CVPR 2021: Technical Report for Streaming Perception Challenge
本文提出了一种基于新型无锚点 YOLOX 模型的实时 2D 目标检测系统,针对自动驾驶场景进行了优化,使用 Argoverse-HD 数据集进行训练。该系统在测试集上实现了 41.0 的流式 AP,通过 TensorRT 部署实现 1440×2304 高分辨率输入下的 30 FPS 推理速度,其在仅检测赛道上的表现优于第二名方法 7.8 AP。
In this report, we introduce our real-time 2D object detection system for the realistic autonomous driving scenario. Our detector is built on a newly designed YOLO model, called YOLOX. On the Argoverse-HD dataset, our system achieves 41.0 streaming AP, which surpassed second place by 7.8/6.1 on detection-only track/fully track, respectively. Moreover, equipped with TensorRT, our model achieves the 30FPS inference speed with a high-resolution input size (e.g., 1440-2304). Code and models will be available at https://github.com/Megvii-BaseDetection/YOLOX
研究动机与目标
- 开发一种快速且准确的 2D 目标检测系统,用于实时自动驾驶感知。
- 在保持高推理速度的同时,提升在 Argoverse-HD 数据集上的检测性能。
- 解决 Argoverse-HD 数据集中因训练数据有限且场景相似而导致的过拟合问题。
- 通过 TensorRT 优化推理速度,以实现真实场景下的部署。
- 在高分辨率输入条件下,实现在流式感知挑战赛中的最先进性能。
提出的方法
- 该系统基于 YOLOX,一种新设计的无锚点 YOLO 模型,具有简化架构和更少的超参数。
- 采用先进的数据增强策略,如 Mosaic 和 Mixup,与 YOLOv4 和 YOLOv5 类似。
- 在训练过程中使用简化版 OTA(最优传输分配)进行标签分配。
- 模型采用类似 YOLOv5-L-P6 的 C3 主干网络进行特征提取。
- 通过 TensorRT 优化推理,将预处理和后处理(NMS)融合到模型前向传播中,实现端到端加速。
- 采用多阶段训练策略:首先在 COCO 上进行预训练,然后在多个数据集(包括 Argoverse-HD、BDD100K、Cityscapes 和 nuScenes)上进行微调,以提升模型的鲁棒性和泛化能力。
实验结果
研究问题
- RQ1基于无锚点 YOLO 的检测器是否能在自动驾驶感知基准上实现更优的准确率与速度?
- RQ2在 COCO 上预训练并结合多数据集微调,对 Argoverse-HD 数据集上的性能有何影响?
- RQ3大规模输入分辨率(1440×2304)对检测准确率和推理延迟有何影响?
- RQ4TensorRT 优化在多大程度上可实现高分辨率下的实时推理?
- RQ5在验证集上进行微调在多大程度上能提升测试集上的在线流式性能?
主要发现
- 所提出的基于 YOLOX 的系统在测试集上实现了 41.0 的流式 AP,优于第二名方法 7.8 AP(仅检测赛道)。
- 在大分辨率输入(1440×2304)下,系统实现了 50.6 的离线 AP,表明其在高分辨率条件下的强大性能。
- 使用 TensorRT 优化,系统在 1440×2304 输入下实现 30 FPS 推理,达到实时推理,延迟极低(28.1 ms/帧)。
- 在 COCO 上预训练使性能从基线的 35.4 AP 提升至 42.8 AP,表现出显著改进。
- 多数据集微调进一步将 AP 提升至 48.7,验证集微调则使在线测试性能提升至 41.0 AP。
- 准确率与延迟之间的权衡显而易见:更高分辨率可提升准确率,但也会增加推理时间,1440×2304 分辨率下达到 50.6 AP,每帧延迟为 28.1 ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。