[论文解读] Topological Planning with Transformers for Vision-and-Language Navigation
该论文提出了一种模块化的视觉-语言导航系统,采用基于Transformer的跨模态注意力机制,在拓扑地图上生成可解释的导航规划,显著优于端到端方法在已见和未见环境中的表现。该方法将规划与控制解耦,通过低层控制器实现鲁棒执行,支持回溯等智能行为。
Conventional approaches to vision-and-language navigation (VLN) are trained end-to-end but struggle to perform well in freely traversable environments. Inspired by the robotics community, we propose a modular approach to VLN using topological maps. Given a natural language instruction and topological map, our approach leverages attention mechanisms to predict a navigation plan in the map. The plan is then executed with low-level actions (e.g. forward, rotate) using a robust controller. Experiments show that our method outperforms previous end-to-end approaches, generates interpretable navigation plans, and exhibits intelligent behaviors such as backtracking.
研究动机与目标
- 解决端到端视觉-语言导航(VLN)模型在自由可 traversable 环境中的局限性。
- 通过利用结构化的拓扑地图而非非结构化记忆,提升导航的鲁棒性和可解释性。
- 通过建模语言与空间拓扑表示之间的跨模态注意力,实现基于自然语言指令的有效规划。
- 开发一种模块化系统,将高层规划与低层控制分离,以提升性能和容错能力。
- 证明拓扑地图与Transformer结合可实现智能行为,如回溯和路径修正。
提出的方法
- 该系统使用跨模态Transformer,基于自然语言指令和拓扑地图,预测一系列拓扑地图节点作为导航规划。
- 规划器关注指令的相关部分以及拓扑地图中对应的空间区域,以生成符号化规划。
- 导航规划由一个鲁棒的局部控制器执行,该控制器使用低层级离散动作(例如,前进、旋转)并维护先前节点的历史记录。
- 拓扑地图由智能体在自由探索后构建,将环境表示为图结构,其中节点代表位置,边代表连通性。
- 控制器以当前节点和前一节点作为输入,实现当智能体偏离规划路径时的回溯。
- 整个系统使用VLN-CE数据集进行评估,性能通过成功率(SR)、SPL以及控制器/规划器成功率(CS/PS)衡量。
实验结果
研究问题
- RQ1基于Transformer的规划器能否有效从自然语言指令中生成拓扑地图上的可解释导航规划?
- RQ2在自由遍历设置下,使用拓扑地图的模块化方法是否相比端到端VLN模型提升了导航性能?
- RQ3当智能体偏离规划路径时,控制器能否学习到鲁棒行为(如回溯)?
- RQ4拓扑地图如何减少搜索空间并提升VLN中的规划效率?
- RQ5语言与空间结构之间的跨模态注意力在多大程度上提升了规划的准确性?
主要发现
- CMTP模型在VLN-CE基准测试中,已见环境的成功率为37.9%,未见环境的成功率为36.3%,显著优于端到端的VLN-CE基线模型。
- CMTP模型在未见环境中的SPL(按路径长度加权的成功率)达到56.2%,远高于端到端基线模型。
- 控制器在执行随机规划时成功率极高(超过80%),即使在未见环境中也表现出色,证明了其低层级控制的鲁棒性。
- 控制器输入中包含前一节点,使回溯行为成为可能,使智能体能够从导航错误中恢复。
- 采用拓扑地图与跨模态规划的模块化系统,性能优于端到端模型,尤其在未见环境中表现更优。
- 定性结果表明,智能体成功执行了直接穿越物体之间的路径(例如,从台球桌到沙发),而非绕行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。