[论文解读] Hierarchical Planning for Long-Horizon Manipulation with Geometric and Symbolic Scene Graphs
该论文提出了一种用于长时程操作的视觉接地分层规划框架,采用两级场景图——几何(6-DoF物体位姿)和符号(语义关系)——通过图神经网络(GNNs)处理,以实现神经符号任务规划和基于图的运动生成。该方法在真实世界任务中实现了70.6%的成功率和89.6%的子目标完成率,推理速度比基于搜索的规划器快四个数量级。
We present a visually grounded hierarchical planning algorithm for long-horizon manipulation tasks. Our algorithm offers a joint framework of neuro-symbolic task planning and low-level motion generation conditioned on the specified goal. At the core of our approach is a two-level scene graph representation, namely geometric scene graph and symbolic scene graph. This hierarchical representation serves as a structured, object-centric abstraction of manipulation scenes. Our model uses graph neural networks to process these scene graphs for predicting high-level task plans and low-level motions. We demonstrate that our method scales to long-horizon tasks and generalizes well to novel task goals. We validate our method in a kitchen storage task in both physical simulation and the real world. Our experiments show that our method achieved over 70% success rate and nearly 90% of subgoal completion rate on the real robot while being four orders of magnitude faster in computation time compared to standard search-based task-and-motion planner.
研究动机与目标
- 解决在高维动作空间和组合复杂性下,真实环境中长时程操作规划的挑战。
- 克服传统任务与运动规划(TAMP)的局限性,后者依赖于手动指定的符号规则和昂贵的搜索过程。
- 在无需大量微调或预定义领域知识的情况下,实现对新任务和更长任务的泛化能力。
- 将视觉感知、符号推理与运动生成整合为一个统一的、端到端可训练的框架,使用结构化场景表征。
提出的方法
- 该方法采用两级场景图表示:几何场景图编码物体的6-DoF位姿及空间关系,符号场景图捕捉实体之间的语义关系。
- 使用神经网络,特别是图神经网络(GNNs),处理两级场景图,分别用于高层任务规划和低层运动生成。
- 高层任务规划采用神经符号回归规划器,从最终目标预测下一个子目标,避免了昂贵的搜索过程。
- 低层运动生成通过GNNs直接从接地的几何场景图预测运动参数(例如,关节角、末端执行器轨迹)。
- 该框架在短时示范轨迹上进行训练,从而实现对更长且未见过的任务的零样本泛化。
- 从RGB图像中估计位姿,实现实时场景图构建,支持真实世界部署中的视觉接地。
实验结果
研究问题
- RQ1基于双级场景图的分层规划框架能否泛化到训练分布之外的长时程操作任务?
- RQ2基于GNN的神经符号规划器与传统基于搜索的规划器相比,在推理速度和成功率方面表现如何?
- RQ3基于图的运动生成在不重新训练的情况下,对新物体配置的泛化能力有多大?
- RQ4GNNs中的关系归纳偏置对规划和运动预测性能有何影响?
- RQ5在真实世界部署中,执行失败和过度执行失败如何影响性能?
主要发现
- 在真实世界实验中,该方法在包含2至6个物体的任务中实现了70.6%的成功率和89.6%的子目标完成率。
- 在使用真实位姿的仿真环境中,该方法在2个物体任务中达到92%的成功率,在6个物体任务中达到67%的成功率,优于随机采样和MLP基线方法。
- 神经符号规划器的推理速度比PDDLStream基于搜索的规划器快四个数量级,将6个物体任务的规划时间从约400秒减少至0.32秒。
- 基于图的运动生成优于随机采样和全连接网络(MLP),GNN由于关系归纳偏置展现出更优的泛化能力。
- 随着任务复杂度增加,执行失败率上升(从2个物体时的7%增至6个物体时的33%),而过度执行失败率在所有任务中均低于1%。
- 该方法展现出强大的零样本泛化能力,成功处理了训练示范中未包含的更长任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。