Skip to main content
QUICK REVIEW

[论文解读] OccNeRF: Advancing 3D Occupancy Prediction in LiDAR-Free Environments

Chubin Zhang, Juncheng Yan|arXiv (Cornell University)|Dec 14, 2023
Video Surveillance and Tracking Methods被引用 7
一句话总结

OccNeRF 提出了一种无需 LiDAR 的自监督多相机 3D 占据预测方法,利用神经辐射场从原始图像渲染深度图,并通过光度一致性实现几何监督。该方法在 nuScenes 数据集上实现了自监督深度估计的最先进性能,并在语义占据预测方面取得了具有竞争力的结果,通过参数化坐标系实现无界场景建模,并采用优化的提示策略实现开放词汇分割。

ABSTRACT

Occupancy prediction reconstructs 3D structures of surrounding environments. It provides detailed information for autonomous driving planning and navigation. However, most existing methods heavily rely on the LiDAR point clouds to generate occupancy ground truth, which is not available in the vision-based system. In this paper, we propose an OccNeRF method for training occupancy networks without 3D supervision. Different from previous works which consider a bounded scene, we parameterize the reconstructed occupancy fields and reorganize the sampling strategy to align with the cameras' infinite perceptive range. The neural rendering is adopted to convert occupancy fields to multi-camera depth maps, supervised by multi-frame photometric consistency. Moreover, for semantic occupancy prediction, we design several strategies to polish the prompts and filter the outputs of a pretrained open-vocabulary 2D segmentation model. Extensive experiments for both self-supervised depth estimation and 3D occupancy prediction tasks on nuScenes and SemanticKITTI datasets demonstrate the effectiveness of our method.

研究动机与目标

  • 在不依赖 LiDAR 点云的前提下,实现视觉主导的自动驾驶系统中的自监督 3D 占据预测。
  • 解决在使用原始 RGB 图像进行自监督 3D 占据学习时,无界场景表示的挑战。
  • 设计一种可微分的渲染流水线,将参数化占据场转换为多相机深度图,以实现光度监督。
  • 通过优化提示策略整合预训练开放词汇分割模型,提升语义占据预测性能,并与占据头结合。
  • 在 nuScenes 基准上验证该方法在自监督设置下的深度估计与语义占据预测性能。

提出的方法

  • 使用将无限空间映射到有界体积的压缩坐标系对 3D 占据场进行参数化,通过不同的坐标变换分离内部与外部区域。
  • 设计一种专用采样策略,高效地从参数化占据场中采样 3D 点,并利用神经渲染将其渲染为多相机深度图。
  • 将多帧序列中的时间光度一致性作为主要几何监督信号,替代基于 LiDAR 的监督。
  • 通过优化的提示策略将预训练的开放词汇分割模型(Grounding DINO)与语义占据监督结合,生成 2D 语义标签。
  • 使用多任务损失联合训练,结合光度一致性损失用于深度估计与交叉熵损失用于语义标签,实现端到端的自监督学习。
  • 采用轻量级 3D 特征聚合模块,直接将 2D 特征插值到 3D 空间,避免计算量大的跨视角注意力层。

实验结果

研究问题

  • RQ1仅使用多相机 RGB 图像而无 LiDAR 监督,能否有效实现自监督 3D 占据预测?
  • RQ2在基于神经辐射场的框架中,如何有效表示并优化无界 3D 场景以实现占据预测?
  • RQ3在自监督设置下,时间光度一致性是否足以提供高质量深度估计的几何监督?
  • RQ4如何有效适配开放词汇分割模型,以在无手动标注的情况下生成可靠的 3D 占据预测语义标签?
  • RQ5在 3D 语义占据预测背景下,何种提示工程策略能最大化开放词汇模型的性能?

主要发现

  • OccNeRF 在 nuScenes 数据集的自监督多相机深度估计任务中达到最先进性能,前向相机的 Abs Rel 达到 0.132,优于先前方法。
  • 该方法在侧视相机上表现尤为突出,F.Left 相机的 Abs Rel 为 0.190,B.Left 相机为 0.204,表明其在具有挑战性的视角下仍具鲁棒性。
  • 在语义占据预测方面,OccNeRF 的性能与全监督方法相比具有竞争力,尤其在使用优化提示策略的开放词汇模型时表现更优。
  • 消融实验表明,时间光度损失在此设置下比直接图像重建损失更有效地提供几何监督。
  • 所提出的坐标压缩与采样策略有效实现了无界场景的建模,显著提升了泛化能力并减少了渲染深度图中的伪影。
  • 定性对比显示,与先前方法相比,OccNeRF 生成的深度图伪影更少、精度更高,尤其在遮挡区域与复杂城市场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。