[论文解读] Transformation-Equivariant 3D Object Detection for Autonomous Driving
本文提出TED,一种针对自动驾驶的高效变换等变3D目标检测器,采用稀疏卷积和新颖的池化模块,学习旋转与反射等变特征。通过将等变体素特征对齐并聚合为紧凑表示,TED在KITTI 3D检测排行榜上实现最先进性能,mAP达到85.28%(中等难度),推理速度低于0.1秒,精度与效率均优于TTA及先前的等变方法。
3D object detection received increasing attention in autonomous driving recently. Objects in 3D scenes are distributed with diverse orientations. Ordinary detectors do not explicitly model the variations of rotation and reflection transformations. Consequently, large networks and extensive data augmentation are required for robust detection. Recent equivariant networks explicitly model the transformation variations by applying shared networks on multiple transformed point clouds, showing great potential in object geometry modeling. However, it is difficult to apply such networks to 3D object detection in autonomous driving due to its large computation cost and slow reasoning speed. In this work, we present TED, an efficient Transformation-Equivariant 3D Detector to overcome the computation cost and speed issues. TED first applies a sparse convolution backbone to extract multi-channel transformation-equivariant voxel features; and then aligns and aggregates these equivariant features into lightweight and compact representations for high-performance 3D object detection. On the highly competitive KITTI 3D car detection leaderboard, TED ranked 1st among all submissions with competitive efficiency.
研究动机与目标
- 为解决现有3D目标检测器中对旋转与反射变化缺乏显式建模的问题,该问题导致模型鲁棒性差且依赖大量数据增强。
- 克服现有等变网络在3D检测中计算成本高、推理速度慢的缺陷,以满足自动驾驶系统对实时性的要求。
- 设计一种高效架构,在保持高检测精度的同时实现端到端实时推理,通过利用变换等变特征学习实现。
- 通过一种新型的距离感知数据增强策略,提升对远距离及稀疏目标的检测能力。
提出的方法
- 提出变换等变稀疏卷积(TeSpConv),通过在多个旋转与反射点云变换中共享权重,提取多通道、变换等变的体素特征。
- 提出变换等变鸟瞰图(TeBEV)池化,将场景级等变特征对齐并聚合为轻量化表示,用于目标候选生成。
- 开发变换不变体素(TiVoxel)池化,将实例级特征对齐并聚合为紧凑的不变表示,用于候选框优化。
- 采用距离感知数据增强(DA-Aug)技术,从邻近密集目标生成稀疏训练样本,以增强远距离目标检测的几何泛化能力。
- 基于两阶段体素化检测流程,通过引入等变设计扩展网络结构,同时利用稀疏运算与特征压缩保持高效性。
- 采用多变换推理策略,结合共享权重与特征对齐,实现在无需重复完整网络前向传播的前提下实现等变性。
实验结果
研究问题
- RQ13D目标检测器是否能在不依赖大量数据增强或测试时集成的情况下,实现对任意旋转与反射的鲁棒性能?
- RQ2如何使变换等变特征学习在计算上足够高效,以满足自动驾驶系统对实时推理的需求?
- RQ3变换等变表示在多大程度上能提升检测精度,特别是对远距离或稀疏目标的检测?
- RQ4一种能从密集周围区域合成稀疏样本的新数据增强策略,是否能有效提升远场目标的检测性能?
主要发现
- TED在KITTI 3D检测基准(中等难度小车类别)上达到85.28%的mAP,截至2022年8月15日,在所有提交结果中排名第一。
- 相比基线模型,TED将mAP提升2.2%,相比TTA提升1.26%,同时将推理时间从0.27秒降低至0.09秒。
- 相比先前的等变检测器EON,TED在mAP(小车,中等难度)上提升9.3%,推理速度更快4.4倍(0.09秒 vs. 0.4秒)。
- 该模型在KITTI验证集上展现出显著提升的方向估计精度(AOS为97.10),表明其方向估计能力更优。
- 所提出的DA-Aug增强策略通过从邻近密集目标生成真实感稀疏训练样本,有效提升了对稀疏与远距离目标的检测性能。
- 在仅使用LiDAR的设置下,TED达到11.1 FPS,精度优于Voxel-RCNN(25 FPS),同时保持了具有竞争力的推理速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。