Skip to main content
QUICK REVIEW

[论文解读] Semantic 3D Occupancy Mapping through Efficient High Order CRFs

Shichao Yang, Yulan Huang|arXiv (Cornell University)|Jul 24, 2017
Robotics and Sensor-Based Localization参考文献 19被引用 5
一句话总结

本文提出了一种基于滚动占用网格的大规模环境中近实时、增量式的语义3D占用映射系统。它利用基于CNN的2D语义分割作为先验输入,并应用一种新型分层高阶CRF,结合基于超像素的$P^N$ Potts势函数,通过高效的基于滤波的期望场推理进行优化,在KITTI数据集上相比最先进方法实现了10%的准确率提升。

ABSTRACT

Semantic 3D mapping can be used for many applications such as robot navigation and virtual interaction. In recent years, there has been great progress in semantic segmentation and geometric 3D mapping. However, it is still challenging to combine these two tasks for accurate and large-scale semantic mapping from images. In the paper, we propose an incremental and (near) real-time semantic mapping system. A 3D scrolling occupancy grid map is built to represent the world, which is memory and computationally efficient and bounded for large scale environments. We utilize the CNN segmentation as prior prediction and further optimize 3D grid labels through a novel CRF model. Superpixels are utilized to enforce smoothness and form robust P N high order potential. An efficient mean field inference is developed for the graph optimization. We evaluate our system on the KITTI dataset and improve the segmentation accuracy by 10% over existing systems.

研究动机与目标

  • 为机器人应用(如导航和虚拟交互)实现实时、大规模的语义3D映射。
  • 解决在计算资源受限且增量式处理的前提下,将2D语义分割与3D几何重建相结合的挑战。
  • 通过高阶CRF势函数强制空间一致性,提升3D分割的准确性。
  • 开发一种可扩展至大规模环境且不损失性能的高阶CRF高效推理方法。
  • 在KITTI基准的真实世界立体序列上展示系统的有效性。

提出的方法

  • 构建3D滚动占用网格地图,以确保在大规模环境中的内存和计算资源限制。
  • 使用预训练的CNN生成2D像素级语义标签分布,作为3D网格单元的单变量势函数。
  • 应用分层CRF模型,其中超像素构成高阶团簇,以强制实现平滑性和区域一致性。
  • 实现一种鲁棒的$P^N$ Potts模型作为高阶势函数,以促进超像素区域内的一致性。
  • 开发一种基于滤波的期望场推理算法,将高阶CRF转化为等效的成对模型,以实现高效优化。
  • 增量式处理帧,仅更新受影响的网格区域,以维持实时性能。

实验结果

研究问题

  • RQ1与成对或密集CRF模型相比,基于超像素团簇的高阶CRF是否能显著提升3D语义标注的准确性?
  • RQ2在基于CPU的推理中,使用分层CRF是否能够实现近实时的大规模3D语义映射?
  • RQ3所提出的基于滤波的期望场推理在效率和准确性上与标准CRF推理方法相比如何?
  • RQ4滚动占用网格在多大程度上实现了内存和计算资源在大规模环境中的可扩展性?
  • RQ5将CNN先验与高阶CRF优化相结合,是否能在真实世界基准上显著超越现有最先进系统?

主要发现

  • 所提系统在KITTI数据集上相比现有最先进系统实现了10%的mIoU(平均交并比)提升。
  • 采用鲁棒$P^N$ Potts势函数的分层CRF在所有评估模型中取得了最高的mIoU(70.3%)和全局准确率(90.6%)。
  • 系统在桌面CPU上运行的分层CRF优化速度约为2 Hz,通过每四帧处理一次,有潜力达到实时速率。
  • 每四帧处理一次仅导致全局准确率下降0.4个百分点(从95.7%降至95.3%),mIoU下降1.3个百分点(从87.6%降至86.3%),表明帧处理减少带来的性能损失极小。
  • 时间分析显示,带有高阶势函数的CRF优化耗时0.53秒/帧,而无高阶项的基线方法耗时0.38秒,证明了所提推理方法的高效性。
  • 可视化结果证实,该方法在处理复杂场景(包括遮挡以及天空、标识牌等困难区域)时具有鲁棒性,语义一致性显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。