Skip to main content
QUICK REVIEW

[论文解读] SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation

Hang Yin, Xiuwei Xu|arXiv (Cornell University)|Oct 10, 2024
Multimodal Machine Learning Applications被引用 4
一句话总结

SG-Nav 提出了一种新颖的零样本 3D 物体导航框架,通过在线层次化 3D 场景图表示环境上下文,并利用层次化思维链提示策略实现基于大语言模型(LLM)的推理。该方法在 MP3D、HM3D 和 RoboTHOR 上实现了最先进性能,成功率达到 10% 以上,同时支持可解释决策,并通过基于图的再感知机制纠正感知错误。

ABSTRACT

In this paper, we propose a new framework for zero-shot object navigation. Existing zero-shot object navigation methods prompt LLM with the text of spatially closed objects, which lacks enough scene context for in-depth reasoning. To better preserve the information of environment and fully exploit the reasoning ability of LLM, we propose to represent the observed scene with 3D scene graph. The scene graph encodes the relationships between objects, groups and rooms with a LLM-friendly structure, for which we design a hierarchical chain-of-thought prompt to help LLM reason the goal location according to scene context by traversing the nodes and edges. Moreover, benefit from the scene graph representation, we further design a re-perception mechanism to empower the object navigation framework with the ability to correct perception error. We conduct extensive experiments on MP3D, HM3D and RoboTHOR environments, where SG-Nav surpasses previous state-of-the-art zero-shot methods by more than 10% SR on all benchmarks, while the decision process is explainable. To the best of our knowledge, SG-Nav is the first zero-shot method that achieves even higher performance than supervised object navigation methods on the challenging MP3D benchmark.

研究动机与目标

  • 为解决现有基于大语言模型的零样本 3D 物体导航方法缺乏场景上下文的问题,这些方法仅依赖附近物体类别进行提示。
  • 通过在层次化 3D 场景图中编码空间与结构关系,提升大语言模型在导航任务中的推理能力。
  • 通过在场景图子图上进行层次化思维链推理,结构化大语言模型的推理过程,实现可解释的决策。
  • 通过在子图上累积可信度分数,纠正感知错误——尤其是错误的终点目标检测。
  • 在无需训练的情况下实现高性能,从而在未见过的环境和开放词汇目标类别中具备强大的泛化能力。

提出的方法

  • 通过高效的基于提示的方法,将新检测到的物体和房间密集连接到现有节点,构建在线、增量式的层次化 3D 场景图。
  • 通过区分远距离与近距离连接,剪枝信息量较少的边,以控制计算复杂度。
  • 将场景图划分为子图,以实现推理的局部化,并为每个子图启用层次化思维链提示。
  • 利用子图推理生成的插值概率分数指导前沿选择,且解释可追溯至特定子图的推理过程。
  • 实现基于图的再感知机制,通过在子图上累积可信度分数,验证目标物体检测结果并拒绝假阳性检测。
  • 利用 2D 视觉-语言模型与视觉基础模型,实现实时在线 3D 实例分割,以构建场景图。

实验结果

研究问题

  • RQ1与简单的物体类别提示相比,层次化 3D 场景图表示是否能提升大语言模型在零样本物体导航中的推理质量?
  • RQ2在场景图子图上采用层次化思维链提示,如何增强决策的可解释性与导航性能?
  • RQ3基于图的再感知机制在多大程度上能纠正错误的终点目标检测,并提升复杂环境下的鲁棒性?
  • RQ4增量且高效的 3D 场景图构建方式,如何在保持丰富空间上下文的同时维持实时性能?
  • RQ5该框架是否能在 MP3D 等挑战性基准中超越零样本甚至有监督的导航基线方法?

主要发现

  • SG-Nav 在 MP3D 基准上实现了 78.4% 的成功率,超越此前最先进零样本方法超过 10%,甚至优于部分有监督方法。
  • 在 HM3D 和 RoboTHOR 上,SG-Nav 相较于最强的先前零样本方法,成功率提升超过 10%。
  • 层次化思维链提示策略实现了完全可解释的导航决策,大语言模型的推理可追溯至特定子图。
  • 消融实验表明,移除组节点会使性能下降 1.1%,移除房间节点会使性能下降 0.7%,表明结构分组的重要性。
  • 再感知机制能有效拒绝假阳性目标物体,减少因误判导致的导航失败。
  • 高效的基于提示的边构建方法使计算复杂度与新节点数量呈线性关系,从而实现场景图的实时更新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。