[论文解读] FocalFormer3D : Focusing on Hard Instance for 3D Object Detection
FocalFormer3D 提出了一种硬样本探测(Hard Instance Probing, HIP)方法,这是一种多阶段框架,通过抑制简单正样本并利用基于框级别的可变形注意力解码器迭代优化预测,实现对难以检测的3D目标(即漏检)的逐步识别与聚焦。该方法在 nuScenes LiDAR 检测任务中取得了 70.5 mAP 和 73.9 NDS 的最先进性能,检测与跟踪排行榜均排名第一。
False negatives (FN) in 3D object detection, {\em e.g.}, missing predictions of pedestrians, vehicles, or other obstacles, can lead to potentially dangerous situations in autonomous driving. While being fatal, this issue is understudied in many current 3D detection methods. In this work, we propose Hard Instance Probing (HIP), a general pipeline that identifies extit{FN} in a multi-stage manner and guides the models to focus on excavating difficult instances. For 3D object detection, we instantiate this method as FocalFormer3D, a simple yet effective detector that excels at excavating difficult objects and improving prediction recall. FocalFormer3D features a multi-stage query generation to discover hard objects and a box-level transformer decoder to efficiently distinguish objects from massive object candidates. Experimental results on the nuScenes and Waymo datasets validate the superior performance of FocalFormer3D. The advantage leads to strong performance on both detection and tracking, in both LiDAR and multi-modal settings. Notably, FocalFormer3D achieves a 70.5 mAP and 73.9 NDS on nuScenes detection benchmark, while the nuScenes tracking benchmark shows 72.1 AMOTA, both ranking 1st place on the nuScenes LiDAR leaderboard. Our code is available at \url{https://github.com/NVlabs/FocalFormer3D}.
研究动机与目标
- 为自动驾驶中的3D目标检测所面临的关键但研究不足的漏检问题提供解决方案。
- 通过在多个阶段显式识别并聚焦于硬样本(即被遗漏的真实标注目标),提升模型的召回率。
- 开发一种可泛化的流程——硬样本探测(HIP),可无缝集成至现有3D检测器中,计算开销极低。
- 通过硬样本的迭代优化,提升在LiDAR和多模态设置下的检测与跟踪性能。
- 减少因遮挡或背景杂乱导致的致命检测错误,如漏检行人或车辆。
提出的方法
- 硬样本探测(HIP)采用多阶段预测流程,每一阶段聚焦于前一阶段的漏检样本,同时抑制已预测的正样本。
- 在各阶段维护一个类别感知的累积正样本掩码,以排除简单正样本,确保模型专注于硬样本。
- 生成多阶段热力图预测,并将其融合形成初始目标候选,每一阶段均对先前遗漏的目标进行检测优化。
- 基于框级别的可变形注意力解码器利用RoIAlign特征执行迭代边界框优化,实现上下文感知的查询交互,提升定位精度。
- 对最终目标候选应用重评分策略,提升选择准确性,超越仅依赖热力图得分排序的效果。
- 该方法实现为 FocalFormer3D,作为现有基于鸟瞰图(BEV)检测器的轻量级扩展,计算开销极低。
实验结果
研究问题
- RQ1多阶段检测流程是否能通过聚焦于硬样本,有效减少3D目标检测中的漏检?
- RQ2对被遗漏的真实标注目标进行迭代探测,如何提升平均召回率与检测性能?
- RQ3基于框的优化与重评分策略对热力图生成的候选目标质量有何影响?
- RQ4所提出的HIP框架在不同传感器模态(包括LiDAR和多模态设置)下的表现如何?
- RQ5该方法在遮挡与复杂背景等挑战性场景下的泛化能力如何?
主要发现
- FocalFormer3D 在 nuScenes 3D LiDAR 检测基准上达到 70.5 mAP 和 73.9 NDS,官方排行榜排名第一。
- 在 nuScenes 跟踪基准上,其 AMOTA 达到 72.1,同样排名第一,表明其在跟踪任务中也具备强大泛化能力。
- 消融实验表明,完整版基于框的优化模块(含可变形注意力与框池化)相比基线,mAP 提升 +1.4,NDS 提升 +1.2。
- 基于池化的掩码策略表现最佳(mAP 提升 +1.2,NDS 提升 +0.7),优于基于框的掩码策略,因其更小的误掩码真实标注风险。
- 仅使用重评分策略即可达到 66.1 mAP,表明初始热力图得分不足以实现准确的候选排序,验证了第二阶段优化的必要性。
- 延迟分析显示,FocalFormer3D 相比 TransFusion-L 仅增加 16ms 开销(总延迟 109ms),主要成本来自主干网络,适用于实时部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。