[论文解读] Learning-based Motion Planning in Dynamic Environments Using GNNs and Temporal Encoding
本文提出了一种基于图神经网络(GNN)的运动规划框架,结合时间编码与模仿学习,以加速动态环境中的在线规划。通过使用DAgger方法,基于SIPP专家策略学习边优先级策略,该方法将碰撞检测次数减少了1000倍以上,同时在2-DoF至7-DoF机械臂上保持高成功率的前提下,将规划速度提升高达95%。
Learning-based methods have shown promising performance for accelerating motion planning, but mostly in the setting of static environments. For the more challenging problem of planning in dynamic environments, such as multi-arm assembly tasks and human-robot interaction, motion planners need to consider the trajectories of the dynamic obstacles and reason about temporal-spatial interactions in very large state spaces. We propose a GNN-based approach that uses temporal encoding and imitation learning with data aggregation for learning both the embeddings and the edge prioritization policies. Experiments show that the proposed methods can significantly accelerate online planning over state-of-the-art complete dynamic planning algorithms. The learned models can often reduce costly collision checking operations by more than 1000x, and thus accelerating planning by up to 95%, while achieving high success rates on hard instances as well.
研究动机与目标
- 解决在存在移动障碍物的动态环境中加速在线运动规划的挑战。
- 通过在高维配置空间中引入时空推理,克服静态学习型规划器的局限性。
- 设计一种GNN架构,能够同时编码图结构与障碍物轨迹,并具备时间感知能力。
- 在不牺牲复杂困难实例成功率的前提下,提升规划效率。
- 在完整算法、启发式基线方法以及端到端强化学习方法中展现出优越性能。
提出的方法
- 采用两阶段GNN架构:首先通过注意力机制编码全局图结构与障碍物轨迹,然后利用局部状态与时间偏移的障碍物数据进行优化。
- 引入受Transformer与NeRF启发的时间编码,以捕捉障碍物运动中的高频时间模式。
- 使用模仿学习(DAgger)端到端训练GNN,以SIPP作为专家策略进行行为克隆与自我优化。
- 通过在线轨迹回放聚合数据,提升泛化能力,尤其在困难规划场景中表现更优。
- 基于学习到的优先级分数对配置图中的边进行优先处理,从而减少昂贵的碰撞检测操作。
- 集成可选的回溯搜索机制,在不增加成功案例中碰撞检测次数的前提下提升成功率。
实验结果
研究问题
- RQ1基于GNN并结合时间编码的模型能否有效学习动态运动规划中的边优先级?
- RQ2与端到端强化学习相比,使用DAgger的模仿学习在学习通用化策略方面表现如何?
- RQ3时空编码在多大程度上能够减少在线规划中的碰撞检测操作?
- RQ4该方法是否能在完整算法难以应对的困难实例上保持高成功率?
- RQ5全局、局部与时间编码组件各自对性能的贡献程度如何?
主要发现
- 与SIPP等最先进的完整算法相比,所提方法将碰撞检测操作减少了1000倍以上。
- 在线规划计算时间最高可提升95%,同时在2-DoF与7-DoF KUKA机械臂任务中保持高成功率。
- 模仿学习结合DAgger优于端到端强化学习方法:DQN在训练集上仅达到54%成功率,PPO在测试集上仅达到20%成功率。
- 消融实验证实,所有组件——全局障碍物编码、局部障碍物编码与时间编码——均显著提升性能,尤其在困难实例中表现突出。
- 可选的回溯搜索机制在不增加成功案例中碰撞检测次数的前提下提升了成功率,证明了效率的提升。
- OracleNet-D(一种先前学习型方法的动态改进版本)在随机问题与困难问题中各项指标均劣于GNN-TE。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。