Skip to main content
QUICK REVIEW

[论文解读] SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB-D Sequences

Shun-Cheng Wu, Johanna Wald|arXiv (Cornell University)|Mar 27, 2021
3D Shape Modeling and Analysis参考文献 60被引用 8
一句话总结

SceneGraphFusion 提出了一种从 RGB-D 序列中实现首个实时、增量式 3D 场景图预测的方法,采用具有新颖注意力机制的图神经网络,以处理部分和不完整数据。该方法在 3D 场景图预测和全景分割任务中达到最先进性能,运行速度达 35Hz,实现了动态环境中全局一致的语义映射。

ABSTRACT

Scene graphs are a compact and explicit representation successfully used in a variety of 2D scene understanding tasks. This work proposes a method to incrementally build up semantic scene graphs from a 3D environment given a sequence of RGB-D frames. To this end, we aggregate PointNet features from primitive scene components by means of a graph neural network. We also propose a novel attention mechanism well suited for partial and missing graph data present in such an incremental reconstruction scenario. Although our proposed method is designed to run on submaps of the scene, we show it also transfers to entire 3D scenes. Experiments show that our approach outperforms 3D scene graph prediction methods by a large margin and its accuracy is on par with other 3D semantic and panoptic segmentation methods while running at 35 Hz.

研究动机与目标

  • 实现从流式 RGB-D 数据中实时、增量式构建 3D 场景图,克服部分、不完整和动态几何结构带来的挑战。
  • 构建一个全局一致的语义场景图,通过时间累积融合子地图的预测结果,确保空间和时间的一致性。
  • 提出一种新型注意力机制,能够在增量学习过程中处理部分 3D 点云中缺失的节点和边。
  • 通过学习 '同一部分' 关系,统一语义和实例级别的理解,类似于全景分割。
  • 在大规模基准测试中保持 35Hz 的实时性能的同时,实现高精度的 3D 场景图预测。

提出的方法

  • 该方法使用几何分割从 RGB-D 序列中提取出具有基本形状的场景组件,形成初始的场景节点。
  • 图神经网络(GNN)聚合邻近片段的特征,节点和边的特征在每帧中增量式更新。
  • 设计用于不完整和动态图的新型自注意力机制,对部分和缺失的边计算注意力权重。
  • GNN 采用多层特征传播机制,其中低层特征被缓存并重用,当仅部分节点被修改时可加速更新。
  • 该框架引入一种新型关系类型 'same part',将多个片段合并为连贯的 3D 实例,实现全景式预测。
  • 通过一种内存高效的更新策略,将预测结果融合回全局一致的 3D 场景图中,重用未改变节点的缓存特征。

实验结果

研究问题

  • RQ1能否在保持全局一致性的同时,从 RGB-D 序列中实时、增量式构建 3D 场景图?
  • RQ2图神经网络如何在增量学习过程中有效处理部分和不完整 3D 数据中缺失的节点和边?
  • RQ3新型注意力机制是否能在动态和不完整观测条件下提升 3D 场景图预测性能?
  • RQ4所提方法在多大程度上可实现与当前最先进 3D 语义和全景分割方法相当的性能?
  • RQ5'same part' 关系的引入是否能增强实例级理解并提升整体场景图质量?

主要发现

  • SceneGraphFusion 在 3D 场景图预测任务中达到 49.3% 的平均 IoU,显著优于先前方法。
  • 该方法运行速度达 35Hz,可在流式 RGB-D 数据上实现实时处理,且不损失精度。
  • 在 ScanNet v2 开放测试集上,采用 '跳过缺失' 策略时,该方法达到 36.3% 的 PQ 分数,优于 PanopticFusion 在 PQ 和 RQ 指标上的表现。
  • 消融实验证明,所提出的注意力机制在平均 IoU 上较 GAT 提升 15.8%,较 SDPA 提升 16.5%。
  • 引入 'same part' 关系显著提升实例级预测性能,相比无此机制的基线方法,PQ 提升 4.8 分。
  • 即使在部分观测条件下,该框架仍保持高精度,在 p50 阈值下达到 41.9% 的平均 IoU,展现出对缺失数据的强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。