[论文解读] An LSTM Approach to Temporal 3D Object Detection in LiDAR Point Clouds
该论文提出了一种基于LSTM的新型框架,用于激光雷达点云中的时序3D目标检测,通过利用稀疏3D卷积特征以及与高分3D点相关联的内存/隐藏状态,提升连续帧之间的检测精度。该方法在单帧基线基础上实现了7.5%的mAP@0.7提升,在多帧拼接方法基础上实现了1.2%的提升,同时通过仅传播相关特征,保持了较低的内存和计算开销。
Detecting objects in 3D LiDAR data is a core technology for autonomous driving and other robotics applications. Although LiDAR data is acquired over time, most of the 3D object detection algorithms propose object bounding boxes independently for each frame and neglect the useful information available in the temporal domain. To address this problem, in this paper we propose a sparse LSTM-based multi-frame 3d object detection algorithm. We use a U-Net style 3D sparse convolution network to extract features for each frame's LiDAR point-cloud. These features are fed to the LSTM module together with the hidden and memory features from last frame to predict the 3d objects in the current frame as well as hidden and memory features that are passed to the next frame. Experiments on the Waymo Open Dataset show that our algorithm outperforms the traditional frame by frame approach by 7.5% mAP@0.7 and other multi-frame approaches by 1.2% while using less memory and computation per frame. To the best of our knowledge, this is the first work to use an LSTM for 3D object detection in sparse point clouds.
研究动机与目标
- 通过利用连续帧之间的时序信息,提升激光雷达点云中的3D目标检测性能,而现有逐帧方法通常忽略这一信息。
- 解决多帧方法中将所有历史点云拼接导致的低效问题,该方法增加了内存和计算开销,且未过滤相关信息。
- 设计一种内存高效且计算轻量的框架,仅保留前一帧中高置信度目标相关特征用于时序推理。
- 探索使用LSTM结合基于3D点的内存和隐藏状态,作为稀疏点云中时空特征聚合的新型机制。
- 在Waymo Open Dataset上超越现有单帧和多帧检测基线,同时保持实时推理能力。
提出的方法
- 该方法使用U-Net风格的稀疏3D卷积网络(SparseConv)从每个激光雷达点云帧中提取特征,随后将这些特征与前一帧的内存和隐藏状态特征进行共体素化(co-voxelization)。
- LSTM模块通过将当前帧特征与前一帧的隐藏状态和内存状态相结合,处理融合后的特征,生成用于下一帧的更新隐藏状态和内存状态。
- 内存和隐藏状态以64维特征表示,与具有高目标性分数的3D点相关联,从而实现空间注意力并提高内存使用效率。
- 每帧仅保留最高分的30,000个隐藏和内存特征点,显著降低内存占用,同时保留相关时序上下文。
- 通过3D检测头从隐藏特征生成预测的边界框,随后使用图卷积和非极大值抑制(NMS)对提议框进行优化。
- 模型在连续激光雷达扫描序列上进行端到端训练,利用自运动(egomotion)对跨帧的内存和隐藏状态进行变换,以保持空间一致性。
实验结果
研究问题
- RQ1基于LSTM的架构能否有效建模3D激光雷达点云中的时序依赖性,从而在单帧推理之外实现检测性能的提升?
- RQ2与传统的多帧特征拼接方法相比,使用基于3D点的内存和隐藏状态在准确率和效率方面表现如何?
- RQ3在大规模3D检测基准上,引入时序上下文能在多大程度上减少误检(false negatives)并提升mAP?
- RQ4一种内存高效、稀疏的LSTM机制能否在保持实时性能的同时,超越单帧和多帧拼接基线?
- RQ5输入帧数如何影响检测性能?用于时序建模的最优序列长度是多少?
主要发现
- 当使用4帧时,所提出的LSTM模型在Waymo Open Dataset上实现了63.6%的mAP@0.7,相比单帧基线提升了7.5%。
- 该模型在强基线(多帧拼接)上实现了1.2%的mAP提升,表明其在特征利用和泛化能力方面更优。
- 7帧的LSTM模型在批量大小为1时达到63.3%的mAP,表明更长的时序序列可进一步提升检测精度。
- 该模型保持了实时推理能力,单帧特征提取时间在Titan V GPU上仅为19ms,远低于100ms的10Hz激光雷达输入预算。
- 通过仅保留每帧30,000个高分特征点而非完整点云,显著提升了内存效率,减少了对背景点的冗余处理。
- 与使用匈牙利匹配和卡尔曼滤波的经典跟踪基线相比,该方法实现了6.8%的mAP提升,表明其具备更优的时序推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。