Skip to main content
QUICK REVIEW

[论文解读] Topological Semantic Graph Memory for Image-Goal Navigation

Nuri Kim, Obin Kwon|arXiv (Cornell University)|Sep 17, 2022
Advanced Image and Video Retrieval Techniques被引用 7
一句话总结

本文提出拓扑语义图记忆(TSGM),一种用于图像目标导航的新框架,通过逐步构建包含图像节点和物体节点的拓扑图以捕捉空间与语义上下文。通过使用跨图混合器融合图像与物体特征,TSGM 提升了导航效率,在最先进基线基础上实现 5.0–9.0% 的成功率提升和 7.0–23.5% 的 SPL 提升,并成功实现在移动机器人上的真实世界部署。

ABSTRACT

A novel framework is proposed to incrementally collect landmark-based graph memory and use the collected memory for image goal navigation. Given a target image to search, an embodied robot utilizes semantic memory to find the target in an unknown environment. % The semantic graph memory is collected from a panoramic observation of an RGB-D camera without knowing the robot's pose. In this paper, we present a topological semantic graph memory (TSGM), which consists of (1) a graph builder that takes the observed RGB-D image to construct a topological semantic graph, (2) a cross graph mixer module that takes the collected nodes to get contextual information, and (3) a memory decoder that takes the contextual memory as an input to find an action to the target. On the task of image goal navigation, TSGM significantly outperforms competitive baselines by +5.0-9.0% on the success rate and +7.0-23.5% on SPL, which means that the TSGM finds efficient paths. Additionally, we demonstrate our method on a mobile robot in real-world image goal scenarios.

研究动机与目标

  • 通过利用地标处的语义与空间上下文,解决在未知、噪声环境下的高效图像目标导航挑战。
  • 克服先前拓扑记忆方法在捕捉 3D 空间关系及跨视角的上下文物体特征方面的局限性。
  • 通过将物体级语义整合到拓扑图结构中,提升图像目标导航的路径效率与成功率。
  • 通过增量图构建与跨模态特征融合,实现视觉导航智能体在真实世界中的鲁棒部署。
  • 证明上下文物体关系显著提升导航性能,尤其在长时程与曲线路径场景中。

提出的方法

  • 使用两种节点类型构建拓扑语义图:图像节点(表示具有 RGB-D 特征的不同视角)和物体节点(表示具有视觉嵌入的独特物体,与视角无关)。
  • 使用 Mask R-CNN 检测并嵌入每张图像中的物体,然后将检测到的物体连接到其可见的最近图像节点。
  • 应用可学习的跨图混合器模块,在图像节点与物体节点之间执行消息传递,通过上下文信息丰富节点表示。
  • 训练一个记忆解码器,基于上下文化的图记忆生成导航动作,实现目标导向的策略学习。
  • 在探索过程中增量式更新图结构,采用交叉更新机制,通过双向信息流同时优化图像节点与物体节点特征。
  • 将图记忆集成到强化学习框架中,实现导航策略的端到端训练。

实验结果

研究问题

  • RQ1是否可以通过整合图像节点与物体节点的拓扑语义图记忆,提升图像目标导航的成功率与路径效率?
  • RQ2在未见过的环境中,整合物体关系(如与其他物体的空间共现)如何增强导航性能?
  • RQ3图像节点与物体节点之间的跨模态消息传递在多大程度上提升了智能体检测与抵达远距离图像目标的能力?
  • RQ4所提出的 TSGM 框架能否泛化至噪声大、非结构化的现实世界机器人导航任务?
  • RQ5物体级语义与图像级特征在提升导航效率与鲁棒性方面,各自贡献如何?

主要发现

  • 在 Gibson 数据集上,TSGM 相较于最先进基线,成功率绝对提升 5.0–9.0%,SPL 提升 7.0–23.5%,表明路径规划效率显著提高。
  • 在高难度、曲线路径任务中,TSGM 实现 91.0% 的 SPL,较之前 SOTA(VGM)提升 45.5 个百分点,表明在复杂导航场景中表现强劲。
  • 消融实验表明,跨图更新(通过彼此特征更新图像与物体节点)性能最高,相较无更新设置,成功率提升 +9.4%,SPL 提升 +7.8%。
  • 引入物体图可降低路径低效性:缺乏物体上下文的智能体常错过目标或陷入死锁,而 TSGM 实现及时的目标识别与终止。
  • 在 Jackal 移动机器人上的真实世界实验验证了 TSGM 的鲁棒性,成功在噪声大、真实的环境中导航至 5–10 米外的目标图像,且基于增量图构建。
  • 该方法有效利用了语义上下文——例如通过冰箱、烤箱与餐桌的存在识别出厨房——展示了超越简单视觉匹配的上下文推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。