[论文解读] LiDAR-based 4D Occupancy Completion and Forecasting
本文提出了基于激光雷达的4D占据完成与预测(OCF)任务,这是一种统一的任务,联合解决稀疏到密集重建、部分到完整幻觉生成以及3D到4D时间预测问题。作者构建了OCFBench数据集,该数据集从公开的激光雷达数据集中整理而来,实验表明联合建模在性能上优于孤立的完成或预测任务,尽管在大规模训练下跨域泛化表现存在中等但稳定的性能下降。
Scene completion and forecasting are two popular perception problems in research for mobile agents like autonomous vehicles. Existing approaches treat the two problems in isolation, resulting in a separate perception of the two aspects. In this paper, we introduce a novel LiDAR perception task of Occupancy Completion and Forecasting (OCF) in the context of autonomous driving to unify these aspects into a cohesive framework. This task requires new algorithms to address three challenges altogether: (1) sparse-to-dense reconstruction, (2) partial-to-complete hallucination, and (3) 3D-to-4D prediction. To enable supervision and evaluation, we curate a large-scale dataset termed OCFBench from public autonomous driving datasets. We analyze the performance of closely related existing baseline models and our own ones on our dataset. We envision that this research will inspire and call for further investigation in this evolving and crucial area of 4D perception. Our code for data curation and baseline implementation is available at https://github.com/ai4ce/Occ4cast.
研究动机与目标
- 将场景补全与占据预测统一为自动驾驶中的一项4D感知任务。
- 解决三大核心挑战:稀疏到密集重建、部分到完整幻觉生成、3D到4D预测。
- 提供一个大规模、精心整理的数据集(OCFBench),包含真实标注以支持监督与评估。
- 评估基线模型,验证OCF任务的可行性与挑战性。
- 激发未来在激光雷达基础上联合进行4D场景理解的研究。
提出的方法
- 从公开的自动驾驶数据集(Lyft、Argoverse、ApolloScape)中构建OCFBench,通过聚合并体素化多个激光雷达扫描帧,生成密集且时间一致的真实标注。
- 应用坐标统一方法以减轻自身运动影响,使模型能够专注于环境动态而非自身运动。
- 设计一个多阶段框架,输入为从t=-T到t=0的稀疏激光雷达扫描序列,输出为t=0到t=T的密集、完成的占据网格,采用欧拉体素表示法。
- 使用体素化点云作为监督信号,通过聚合多个扫描帧而非依赖单帧代理,避免深度渲染偏差。
- 实现基线模型,包括PCF、ConvLSTM和Conv3D,采用不同输入/输出序列长度与模型架构复杂度。
- 应用推理时适应与跨域评估,以评估在不同传感器配置与环境下的泛化能力。
实验结果
研究问题
- RQ1统一的4D感知框架是否能比孤立的方法更有效地联合建模场景补全与占据预测?
- RQ2尽管经过大规模训练,当从一种传感器配置(如Lyft)迁移到另一种(如Argoverse或ApolloScape)时,模型性能会如何下降?
- RQ3在4D占据预测中,模型性能(mIoU、mAP)与计算成本(MACs、内存、推理时间)之间存在何种权衡?
- RQ4现有3D场景补全或3D预测模型在不进行架构重构的情况下,能在多大程度上被适配到新的OCF任务中?
- RQ5OCF任务的设定对传感器配置与环境复杂度的变化具有多大鲁棒性?
主要发现
- 与孤立的SSC或预测任务相比,OCF任务显著增加了复杂性,表现为将现有模型扩展到该任务时性能下降。
- 跨域泛化表现出现明显性能下降:PCF在OCFBench-Argoverse上的mIoU从54.05降至45.75,在OCFBench-ApolloScape上从59.61降至50.19,尽管OCFBench-Lyft的数据量是Argoverse的两倍、ApolloScape的四倍。
- Conv3D架构在mIoU与mAP上表现最佳,但计算成本最高,达到6.51 TFLOPs的MACs、34M参数量与23GB内存占用。
- ConvLSTM在性能与效率之间提供了更好的平衡,其参数量不随序列长度变化,更适合实时部署。
- PCF基线模型在不同领域间表现出较强的泛化能力,但仍遭受显著性能下降,表明需要域不变表示。
- 在不同传感器配置下,模型性能基本保持不变,表明在充分监督下OCF任务对传感器差异具有鲁棒性,但领域差异仍是主要挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。