Skip to main content
QUICK REVIEW

[论文解读] Differentiable Spatial Planning using Transformers

Devendra Singh Chaplot, Deepak Pathak|arXiv (Cornell University)|Dec 2, 2021
Robotic Path Planning Algorithms被引用 6
一句话总结

本文提出空间规划变换器(SPT),一种可微分的、基于注意力机制的规划器,能够捕捉障碍物地图中的长程空间依赖关系,从而实现高效、数据驱动的路径规划。通过利用自注意力机制在无遮挡距离上传播数值,SPT 将规划迭代次数从 O(D) 降低至 O(n_O),在导航与操作任务中相较先前的端到端规划器实现 7–19% 的绝对精度提升。

ABSTRACT

We consider the problem of spatial path planning. In contrast to the classical solutions which optimize a new plan from scratch and assume access to the full map with ground truth obstacle locations, we learn a planner from the data in a differentiable manner that allows us to leverage statistical regularities from past data. We propose Spatial Planning Transformers (SPT), which given an obstacle map learns to generate actions by planning over long-range spatial dependencies, unlike prior data-driven planners that propagate information locally via convolutional structure in an iterative manner. In the setting where the ground truth map is not known to the agent, we leverage pre-trained SPTs in an end-to-end framework that has the structure of mapper and planner built into it which allows seamless generalization to out-of-distribution maps and goals. SPTs outperform prior state-of-the-art differentiable planners across all the setups for both manipulation and navigation tasks, leading to an absolute improvement of 7-19%.

研究动机与目标

  • 开发一种数据驱动的、可微分的规划器,以捕捉现实环境中诸如墙体对齐与空间一致性的统计规律。
  • 克服传统规划器依赖完整真实地图且在动态环境中效率低下的局限性。
  • 实现端到端的轨迹学习,无需真实地图监督,从而实现对分布外地图的泛化能力。
  • 通过用长程注意力传播替代局部迭代值传播(如通过 CNN 实现),提升规划效率。
  • 在稀疏与噪声监督条件下,于导航与机器人操作任务中均展示出强大的泛化能力与性能提升。

提出的方法

  • SPT 使用带有多头自注意力机制的变换器架构,对整个障碍物地图中的空间关系进行建模,实现长程值传播。
  • 该模型将障碍物地图视为一组空间标记(spatial tokens),每个标记可关注所有其他标记,从而在无障碍物阻挡时实现距离值的直接传播。
  • 与仅在局部邻域内传播值的卷积网络不同,SPT 的注意力机制使迭代次数从 O(D) 降低至 O(n_O),其中 n_O 为障碍物数量,D 为路径长度。
  • 规划器通过可微分规划损失进行端到端训练,支持反向传播通过规划轨迹,以优化路径精度。
  • 在未知地图设置下,SPT 与一个可学习的映射器集成于端到端框架中,实现仅从原始观测与轨迹联合完成地图构建与规划。
  • 该模型在导航(如 Gibson 数据集)与操作(配置空间)任务上进行评估,并对地图尺寸、噪声水平与监督程度进行了消融研究。

实验结果

研究问题

  • RQ1基于变换器的规划器是否能通过利用长程空间注意力,在规划精度与推理速度方面超越基于卷积的规划器?
  • RQ2当在无真实地图监督下进行训练时,可微分规划器在多大程度上能泛化到分布外地图?
  • RQ3在注意力机制与局部传播规划器之间,规划迭代次数随地图尺寸与障碍物数量的增加如何变化?
  • RQ4仅使用轨迹与稀疏监督,能否通过端到端训练映射器-规划器系统实现在真实环境中的高性能表现?
  • RQ5模型在长程空间依赖关系上的推理能力是否能带来在噪声或稀疏观测条件下的路径精度与鲁棒性上的可测量提升?

主要发现

  • 在所有测试的导航与操作设置中,SPT 相较于先前的最先进端到端规划器(VIN 与 GPPN)实现了 7–19% 的绝对精度提升。
  • 该模型将所需规划迭代次数从 O(D) 降低至 O(n_O),其中 D 为最短路径距离,n_O 为障碍物数量,从而在大地图上实现更快的推理速度。
  • 在噪声与稀疏监督下的端到端地图构建与规划中,SPT 的平均地图构建与规划精度高于基线模型,展现出对不完整地图信息的强鲁棒性。
  • 在无真实地图监督下进行训练时,SPT 能够有效泛化到分布外地图,证明了其从真实世界数据中部署的可行性。
  • 与卷积基线相比,该模型在地图尺寸增大时展现出显著更优的可扩展性,在大而复杂的环境中仍能保持高精度。
  • 消融研究证实,长程注意力对性能至关重要;依赖局部传播的模型在大地图上无法泛化或需过多迭代。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。