Skip to main content
QUICK REVIEW

[论文解读] Fast and Accurate Semantic Mapping through Geometric-based Incremental Segmentation

Yoshikatsu Nakajima, Keisuke Tateno|arXiv (Cornell University)|Mar 7, 2018
Robotics and Sensor-Based Localization参考文献 26被引用 5
一句话总结

该论文提出了一种实时、可扩展的语义映射系统,该系统为几何片段分配类别概率,而非单个surfels,显著降低了计算和内存开销。通过将低分辨率卷积神经网络与几何分割及概率融合相结合,该方法在标准硬件上实现了30.9 Hz的帧率,且在NYUv2数据集上达到与最先进方法相当的精度,无需后处理。

ABSTRACT

We propose an efficient and scalable method for incrementally building a dense, semantically annotated 3D map in real-time. The proposed method assigns class probabilities to each region, not each element (e.g., surfel and voxel), of the 3D map which is built up through a robust SLAM framework and incrementally segmented with a geometric-based segmentation method. Differently from all other approaches, our method has a capability of running at over 30Hz while performing all processing components, including SLAM, segmentation, 2D recognition, and updating class probabilities of each segmentation label at every incoming frame, thanks to the high efficiency that characterizes the computationally intensive stages of our framework. By utilizing a specifically designed CNN to improve the frame-wise segmentation result, we can also achieve high accuracy. We validate our method on the NYUv2 dataset by comparing with the state of the art in terms of accuracy and computational efficiency, and by means of an analysis in terms of time and space complexity.

研究动机与目标

  • 解决机器人和AR应用中实时语义3D映射的高计算成本问题。
  • 克服在surfel级别更新类别概率的低效性,该方法在场景复杂度增加时扩展性差。
  • 在市售硬件上实现30+ Hz的实时性能,同时保持高精度。
  • 通过在片段级别而非每个surfel上存储类别概率,降低内存使用量。
  • 消除语义标注中对后处理技术(如条件随机场CRFs)的依赖。

提出的方法

  • 使用基于surfel的SLAM框架(InfiniTAM v3)逐步构建稠密3D地图,以实现鲁棒的相机跟踪和3D重建。
  • 应用基于几何的增量分割,根据表面法线和深度不连续性将surfels分组为有意义的区域。
  • 为每个片段分配类别概率,而非单个surfels,从而降低时间和空间复杂度。
  • 使用轻量级、低分辨率CNN(输入尺寸为40×30)实时优化分割边界,每帧推理仅耗时19.32ms。
  • 通过仅更新每帧中可见片段的概率融合策略,实现概率融合,最大限度减少冗余计算。
  • 利用当前相机位姿渲染的视图,实现2D到3D的标签迁移,确保3D地图中语义标注的一致性。

实验结果

研究问题

  • RQ1语义映射能否在保证高精度的同时,高效到足以实现在标准硬件上的实时部署?
  • RQ2与在surfel级别相比,在片段级别分配类别概率是否能显著降低时间和空间复杂度?
  • RQ3当与几何分割结合使用时,低分辨率CNN能否实现高语义分割精度?
  • RQ4在无需后处理的情况下,该方法在帧率、内存使用量和精度方面与最先进方法相比如何?
  • RQ5在几何分割中引入语义信息在多大程度上能提升分割质量?

主要发现

  • 该方法在GeForce GTX 1080上实现了30.9 Hz的帧率,优于先前方法如SemanticFusion(25.3 Hz)和Hermans et al.(4 Hz),且处理每一帧。
  • 更新类别概率的平均耗时仅为1.37ms,远低于SemanticFusion的41.1ms,显著降低了时间复杂度。
  • 由于采用每片段存储概率(Nₗ = 1032)而非每surfel(Nₛ = 844,260),存储类别概率的内存使用量降低至SemanticFusion的0.08%。
  • 该方法在NYUv2数据集上的语义精度与最先进方法相当,与全精度版本相比,mIoU仅下降0.8%。
  • 语义感知边界的引入改善了几何分割质量,减少了噪声并更准确地捕捉语义边界,如定性对比所示。
  • 该系统消除了对CRFs等后处理技术的需求,简化了处理流程并降低了计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。