Skip to main content
QUICK REVIEW

[论文解读] UniOcc: Unifying Vision-Centric 3D Occupancy Prediction with Geometric and Semantic Rendering

Mingjie Pan, Li Liu|arXiv (Cornell University)|Jun 15, 2023
Advanced Vision and Imaging被引用 5
一句话总结

UniOcc 提出了一种以视觉为中心的统一框架,用于3D占据预测,通过体素渲染整合来自2D图像的几何与语义监督,从而减少对昂贵3D标注的依赖。通过使用射线采样从3D体素特征中渲染深度和语义logits,该方法在nuScenes基准上实现了51.27%的mIoU,且仅使用单一模型,在CVPR 2023挑战赛中排名第三。

ABSTRACT

In this technical report, we present our solution, named UniOCC, for the Vision-Centric 3D occupancy prediction track in the nuScenes Open Dataset Challenge at CVPR 2023. Existing methods for occupancy prediction primarily focus on optimizing projected features on 3D volume space using 3D occupancy labels. However, the generation process of these labels is complex and expensive (relying on 3D semantic annotations), and limited by voxel resolution, they cannot provide fine-grained spatial semantics. To address this limitation, we propose a novel Unifying Occupancy (UniOcc) prediction method, explicitly imposing spatial geometry constraint and complementing fine-grained semantic supervision through volume ray rendering. Our method significantly enhances model performance and demonstrates promising potential in reducing human annotation costs. Given the laborious nature of annotating 3D occupancy, we further introduce a Depth-aware Teacher Student (DTS) framework to enhance prediction accuracy using unlabeled data. Our solution achieves 51.27\% mIoU on the official leaderboard with single model, placing 3rd in this challenge.

研究动机与目标

  • 通过利用成本较低的2D分割标签,减少在3D占据预测中对昂贵3D语义标注的依赖。
  • 通过体素渲染整合几何遮挡约束与语义一致性,提升模型性能。
  • 通过深度感知的教师-学生框架,实现利用未标注数据的自监督学习。
  • 通过测试时增强和改进的特征表示,提升模型的泛化能力与鲁棒性。
  • 在无需架构重构的前提下,实现在以视觉为中心的3D占据预测基准上的最先进性能。

提出的方法

  • 使用独立的MLP分别表示密度(σ)和语义logits(s),将3D体素预测转换为类似NeRF的表示形式。
  • 沿来自2D图像像素的射线进行体素渲染,利用alpha混合方法生成渲染深度D和语义logits S。
  • 应用尺度不变对数(SILog)损失来监督渲染深度,强制实现几何一致性与遮挡关系。
  • 将来自LiDAR投影的稀疏2D深度与语义标签作为渲染像素的监督目标,训练期间仅关注已标注像素。
  • 提出一种深度感知的教师-学生(DTS)框架,通过增强教师模型的深度预测来稳定未标注数据上的自监督训练。
  • 在图像和鸟瞰图层面同时应用水平与垂直翻转的测试时增强(TTA),以提升推理鲁棒性。

实验结果

研究问题

  • RQ1通过体素渲染实现的2D监督能否替代昂贵的3D占据标注,同时保持或提升性能?
  • RQ2通过渲染深度整合几何约束,如何改善3D占据预测?
  • RQ3采用DTS框架的自监督学习能否有效利用未标注数据以提升性能?
  • RQ4先进的2D标注工具(如SAM)在3D场景理解中,能在多大程度上降低2D语义标注的成本?
  • RQ5架构增强(如更高分辨率体素与更强骨干网络)对占据预测准确率有何影响?

主要发现

  • UniOcc在nuScenes测试集上以单一模型实现51.27%的mIoU,位列CVPR 2023 3D占据预测挑战赛第3名。
  • 仅使用体素渲染监督(无3D标签)训练的模型,性能优于仅使用3D标签监督训练的模型,证明了基于2D学习的有效性。
  • 在BEVStereo基线模型上,仅使用渲染监督即可达到20.2 mIoU,超过仅使用3D标签监督的19.6 mIoU。
  • 完整模型(包含可见性掩码、更强骨干网络、更高分辨率、TTA与DTS)在验证集上达到52.1 mIoU。
  • DTS框架通过增强教师模型的深度预测,实现了稳定的自监督训练,提升了在未标注数据上的泛化能力。
  • 使用ConvNeXt-Base并提高体素分辨率至0.32m(250×250×20)显著提升性能,凸显了更丰富特征表示的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。