Skip to main content
QUICK REVIEW

[论文解读] Where are the Keys? -- Learning Object-Centric Navigation Policies on Semantic Maps with Graph Convolutional Networks

Niko Sünderhauf|arXiv (Cornell University)|Sep 16, 2019
Multimodal Machine Learning Applications参考文献 32被引用 8
一句话总结

本文提出了一种基于图卷积网络(GCN)的导航策略,通过利用FastText词向量实现语义相似性,使机器人能够在语义地图上定位未映射的可移动物体(例如钥匙、遥控器)。该策略在未见过的物体类别和环境中表现出良好的泛化能力,性能下降极小,在新环境中的成功率达到96%,对未见类别的性能接近最优(oracle)水平,其样本效率通过代理任务的预训练得到提升。

ABSTRACT

Emerging object-based SLAM algorithms can build a graph representation of an environment comprising nodes for robot poses and object landmarks. However, while this map will contain static objects such as furniture or appliances, many moveable objects (e.g. the car keys, the glasses, or a magazine), are not suitable as landmarks and will not be part of the map due to their non-static nature. We show that Graph Convolutional Networks can learn navigation policies to find such unmapped objects by learning to exploit the hidden probabilistic model that governs where these objects appear in the environment. The learned policies can generalise to object classes unseen during training by using word vectors that express semantic similarity as representations for object nodes in the graph. Furthermore, we show that the policies generalise to unseen environments with only minimal loss of performance. We demonstrate that pre-training the policy network with a proxy task can significantly speed up learning, improving sample efficiency.

研究动机与目标

  • 解决在传统SLAM系统不追踪它们的家用环境中导航至非静态、未映射物体(如钥匙、遥控器)的挑战。
  • 开发一种利用词向量表示实现语义相似性的导航策略,以实现对未见物体类别的泛化。
  • 通过引入代理任务进行策略网络的预训练,提升强化学习中的样本效率。
  • 评估策略在具有不同物体放置分布和图结构的新环境中的泛化能力。

提出的方法

  • 该方法使用基于图的语义地图,包含位姿节点和静态物体地标,表示为图结构,其中节点为机器人位姿和静态物体,边编码空间和语义关系。
  • 图卷积网络(GCN)作为策略网络,处理图结构并输出导航目标位姿节点的概率分布。
  • 通过FastText词向量对物体类别进行嵌入,以捕捉语义相似性,从而实现对未见物体类别的零样本泛化。
  • 策略通过强化学习进行训练,奖励函数基于与目标物体的距离以及稀疏密集奖励进行设计。
  • 引入一个代理任务——基于语义上下文预测物体放置概率——用于预训练GCN,以加速下游策略学习。
  • 通过在具有不同物体放置分布和图结构的新环境中测试策略,评估其泛化能力。

实验结果

研究问题

  • RQ1基于GCN的策略是否能仅依靠静态地标和位姿节点的语义地图,学习导航至非静态、未映射的目标物体?
  • RQ2该策略在仅依赖词向量表示的语义相似性下,对训练中未见过的物体类别的泛化能力如何?
  • RQ3在导航任务中,基于代理任务的预训练在多大程度上提升了样本效率和最终性能?
  • RQ4该策略对未见环境中环境布局和物体放置分布变化的鲁棒性如何?
  • RQ5该策略是否能泛化到具有不同图拓扑结构和概率性物体放置规则的全新环境中?

主要发现

  • 该策略在未见环境中的成功率达到96%,仅比训练环境中的99%略有下降,表明其对新布局和物体放置分布具有强大的泛化能力。
  • 通过代理任务预训练,策略在未见环境中的平均到达步数从2.39减少至2.0,表明样本效率提高且收敛更快。
  • 该策略能有效泛化至未见物体类别:对语义上相似的未见物体(如黄油、酸奶)性能接近最优策略,大多数类别的成功率超过90%。
  • 与随机搜索相比,该策略性能显著更优,在未见环境中的成功率达到96%,而随机导航仅为30%。
  • 使用FastText词向量实现了对未见物体类别的零样本泛化,例外情况为训练数据中缺乏语义邻近类别的物体(如手机)。
  • 该策略对图结构和布局变化具有鲁棒性,表明其学习的是不变的、上下文感知的导航策略,而非记忆特定环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。