Skip to main content
QUICK REVIEW

[论文解读] Evolving Graphical Planner: Contextual Global Planning for Vision-and-Language Navigation

Zhiwei Deng, Karthik Narasimhan|arXiv (Cornell University)|Jul 11, 2020
Multimodal Machine Learning Applications参考文献 53被引用 14
一句话总结

该论文提出了一种动态演化图规划器(Evolving Graphical Planner, EGP),这是一种视觉-语言导航智能体,能够从原始感官输入动态构建图形地图,并通过可扩展的代理图表示实现全局规划。通过纯模仿学习,EGP在Room-to-Room测试集上实现了53%的成功率,比之前的方法高出5个百分点,通过实现灵活、上下文感知的决策以及无需强化学习的高效长距离规划,显著提升了性能。

ABSTRACT

The ability to perform effective planning is crucial for building an instruction-following agent. When navigating through a new environment, an agent is challenged with (1) connecting the natural language instructions with its progressively growing knowledge of the world; and (2) performing long-range planning and decision making in the form of effective exploration and error correction. Current methods are still limited on both fronts despite extensive efforts. In this paper, we introduce the Evolving Graphical Planner (EGP), a model that performs global planning for navigation based on raw sensory input. The model dynamically constructs a graphical representation, generalizes the action space to allow for more flexible decision making, and performs efficient planning on a proxy graph representation. We evaluate our model on a challenging Vision-and-Language Navigation (VLN) task with photorealistic images and achieve superior performance compared to previous navigation architectures. For instance, we achieve a 53% success rate on the test split of the Room-to-Room navigation task through pure imitation learning, outperforming previous navigation architectures by up to 5%.

研究动机与目标

  • 解决在部分可观测条件下,视觉-语言导航中的长距离、上下文感知规划挑战。
  • 克服在复杂、未见过的3D环境中,局部控制策略和基于规则的搜索算法的局限性。
  • 通过可扩展的、端到端可微的框架,实现有效的全局动作选择与错误纠正。
  • 设计一种避免强化学习的训练范式,通过模仿学习和图增强监督保持高性能。
  • 设计一种内存高效的规划机制,基于代理图而非完整拓扑图运行,以降低计算成本。

提出的方法

  • 在在线探索过程中,使用离散符号表示已访问状态和未探索动作,动态构建环境的图形地图。
  • 引入代理图——完整地图的局部近似——以实现在不产生高时间或内存开销的前提下可扩展的规划。
  • 采用全局规划模块,基于自然语言指令从丰富且上下文相关的动作空间中选择动作。
  • 使用模仿学习结合图增强监督(而非最短路径监督)进行端到端策略训练。
  • 采用top-K动作选择策略,结合可学习的图维度(256)和多头注意力机制,以建模长距离依赖关系。
  • 维护一个可演化的图表示,支持导航过程中的回溯与路径修正。

实验结果

研究问题

  • RQ1视觉-语言导航智能体是否仅依靠原始视觉输入和自然语言指令即可实现有效的全局规划?
  • RQ2如何为实时导航中大规模、动态增长的地图设计一种可扩展且高效的规划机制?
  • RQ3仅靠模仿学习是否足以在无需强化学习或拓扑结构预训练的情况下实现高性能的全局规划?
  • RQ4使用代理图与完整拓扑图相比,对规划效率和导航成功率有何影响?
  • RQ5图增强监督如何提升导航任务中的泛化能力与与专家轨迹的一致性?

主要发现

  • EGP仅通过模仿学习就在Room-to-Room测试集上实现了53%的成功率,比之前方法最高高出5个百分点。
  • 在Room-for-Room基准上,EGP取得了44.4的CLS分数、37.4的nDTW和17.5的SDTW,所有指标均优于之前方法4.9至7.0分,尤其在保真度导向指标上表现突出。
  • 尽管采用了全局规划,模型仍保持了相对较短的路径长度(18.3),避免了基于规则的全局搜索算法常见的长路径问题。
  • 消融实验证实,图增强监督和使用代理图相比最短路径监督与全图规划,显著提升了性能。
  • EGP在性能上超越了SOTA模型如Speaker-Follower和PTA智能体,即使其完全依赖模仿学习而未使用强化学习。
  • 该方法表明,采用全局动作空间和动态图表示的端到端训练,能够实现稳健的错误纠正与长距离推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。