Skip to main content
QUICK REVIEW

[论文解读] SceneGraphNet: Neural Message Passing for 3D Indoor Scene Augmentation

Yang Zhou, Zachary While|arXiv (Cornell University)|Jul 25, 2019
Robotics and Sensor-Based Localization参考文献 23被引用 6
一句话总结

SceneGraphNet 提出一种图神经网络,结合迭代神经消息传递与注意力机制,用于预测 3D 室内场景中缺失位置的合理物体类型。通过在密集场景图中建模空间与结构关系,该方法在 SUNCG 数据集上将零样本物体预测准确率提升 16%(从 51% 提高到 67%),优于先前方法,同时实现上下文感知识别与迭代场景生成。

ABSTRACT

In this paper we propose a neural message passing approach to augment an input 3D indoor scene with new objects matching their surroundings. Given an input, potentially incomplete, 3D scene and a query location, our method predicts a probability distribution over object types that fit well in that location. Our distribution is predicted though passing learned messages in a dense graph whose nodes represent objects in the input scene and edges represent spatial and structural relationships. By weighting messages through an attention mechanism, our method learns to focus on the most relevant surrounding scene context to predict new scene objects. We found that our method significantly outperforms state-of-the-art approaches in terms of correctly predicting objects missing in a scene based on our experiments in the SUNCG dataset. We also demonstrate other applications of our method, including context-based 3D object recognition and iterative scene generation.

研究动机与目标

  • 解决在不完整 3D 室内场景中预测缺失或查询位置合理物体类型的问题。
  • 通过利用场景物体之间的上下文关系而非仅依赖物体外观来提升 3D 物体识别性能。
  • 通过逐步填充上下文合理的物体,实现 3D 场景的迭代增强。
  • 使用统一的图表示法,同时建模室内场景中的局部与长距离关系,包含多种关系类型。
  • 开发一种消息传递机制,通过注意力动态加权相关场景上下文,提升预测的鲁棒性与准确性。

提出的方法

  • 将 3D 室内场景表示为密集图,其中节点为物体,边编码多种关系类型:支撑、相邻、共现与环绕。
  • 采用消息传递框架,每个节点通过学习的、与关系类型相关的神经模块从邻居聚合消息。
  • 使用门控循环单元(GRU)在多轮迭代中聚合消息,实现在图中动态整合上下文信息。
  • 应用注意力机制对传入消息进行加权,根据相关性使模型聚焦于最具有信息量的场景上下文。
  • 在多轮迭代中执行迭代式消息传递以优化物体预测,性能在三轮后趋于稳定。
  • 将 SceneGraphNet 的预测结果与多视角 CNN 特征(如 MVCNN)结合,以提升上下文感知的 3D 物体识别性能。

实验结果

研究问题

  • RQ1在密集场景图上使用神经消息传递框架,能否有效预测不完整 3D 室内场景中的缺失物体类型?
  • RQ2不同图结构(如树状、稀疏、全连接)以及不同消息聚合机制(如求和、取最大值、GRU)如何影响预测性能?
  • RQ3与均匀或基于距离的加权方式相比,引入基于注意力的消息加权在多大程度上提升了物体预测的准确性?
  • RQ4该方法能否通过利用超越外观特征的场景上下文,提升 3D 物体识别性能?
  • RQ5在物体逐步添加至不完整场景的迭代场景生成中,该方法的效率如何?

主要发现

  • SceneGraphNet 将 SUNCG 数据集上的零样本物体预测准确率从 51% 提升至 67%,相对优于先前最先进方法 16%。
  • 经过三轮消息传递后,该方法的 top-5 准确率达到 89.5%,性能在该点趋于稳定,后续波动极小。
  • 结合 SceneGraphNet 与 MVCNN 的上下文感知物体识别,将测试场景中的平均分类准确率从 59.2% 提升至 72.2%。
  • 消融实验证实,包含 GRU 聚合、注意力加权与密集图结构的完整模型优于所有变体,包括使用求和、取最大值或普通 RNN 聚合的模型。
  • 该方法预测物体尺寸的平均误差为 26 cm,优于 GRAINS(38 cm 误差),表明在场景增强中具有更优的几何一致性。
  • 该模型在多样化房间类型中表现出强泛化能力,如图 8 所示,随着房间内物体数量增加,top-3 分类准确率显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。