[论文解读] Learning Neuro-Symbolic Skills for Bilevel Planning
本文提出了一种神经符号技能的双层规划方法,通过演示联合学习符号算子、神经子目标采样器和子目标条件策略。通过将这些组件整合为模块化技能,该方法在连续、高维的机器人环境中实现了高效且可泛化的任务与运动规划,在四个领域中均优于六个基线方法,未见任务的成功率达到90–98%。
Decision-making is challenging in robotics environments with continuous object-centric states, continuous actions, long horizons, and sparse feedback. Hierarchical approaches, such as task and motion planning (TAMP), address these challenges by decomposing decision-making into two or more levels of abstraction. In a setting where demonstrations and symbolic predicates are given, prior work has shown how to learn symbolic operators and neural samplers for TAMP with manually designed parameterized policies. Our main contribution is a method for learning parameterized polices in combination with operators and samplers. These components are packaged into modular neuro-symbolic skills and sequenced together with search-then-sample TAMP to solve new tasks. In experiments in four robotics domains, we show that our approach -- bilevel planning with neuro-symbolic skills -- can solve a wide range of tasks with varying initial states, goals, and objects, outperforming six baselines and ablations. Video: https://youtu.be/PbFZP8rPuGg Code: https://tinyurl.com/skill-learning
研究动机与目标
- 解决在稀疏反馈和高维动作空间下,长时序、连续状态机器人决策的挑战。
- 通过使技能能够实现与同一符号效果一致的多个子目标,克服符号抽象在任务与运动规划中的局限性。
- 允许在符号目标相同但符号抽象存在损失的情况下,对多个技能序列进行规划。
- 从演示中端到端联合学习参数化策略、算子和采样器,无需事先知道技能数量。
- 实现符号与技能相互学习的自增强循环。
提出的方法
- 神经符号技能被结构化为一个符号算子、一个神经子目标条件策略和一个神经子目标采样器,形成一个模块化、可学习的单元。
- 子目标采样器生成与符号效果一致的环境状态,解决了每个符号结果需对应多个可行子目标的需求。
- 策略基于采样得到的子目标进行条件控制,并执行动作以抵达目标,从而在不同初始状态下实现泛化。
- 双层规划使用外层AI规划循环对符号算子进行搜索,内层采样循环用于测试可行性,必要时可回退至备选序列。
- 技能通过模仿学习从1000个演示中端到端训练,无需事先知道技能数量。
- 该框架支持从手动设计和学习得到的谓词中进行学习,从而实现符号与技能发现的良性循环。
实验结果
研究问题
- RQ1能否从演示中学习神经符号技能,以实现在连续机器人环境中对多样化初始状态和目标的泛化?
- RQ2如何设计一种技能,使其能够到达满足同一符号效果的多个环境状态(子目标),尤其是在符号抽象存在损失的情况下?
- RQ3在具有连续动作和状态、稀疏奖励的长时序设置下,使用学习得到的神经符号技能的双层规划能否优于基线方法?
- RQ4能否从自动发现的谓词中学习技能,从而实现符号与技能协同创造的自增强系统?
- RQ5与手动设计的对应方法相比,学习得到的采样器和策略在规划效率和成功率方面表现如何?
主要发现
- 在Cover、Doors、Stick Button和Coffee环境中,所提方法(BPNS)分别实现了90.40%、98.00%、98.00%和98.00%的任务成功率,标准差均低于2%。
- 该方法在未见初始状态和目标上的泛化能力优于六个基线方法和消融实验,包括使用手动设计技能的方法。
- 在Cover环境中,使用学习得到的技能进行规划平均仅需320.32个节点创建,显著少于使用最优技能(oracle skills)所需的53.68个,表明搜索效率更高。
- 实际运行时间方面,使用学习得到的技能耗时更长(如Coffee环境中为53.68秒),而使用最优技能仅需67.25秒,主要由于神经网络推理开销所致。
- 当在学习得到的谓词而非手动设计的谓词上进行训练时,方法仍实现了99.20%的成功率,表明端到端符号与技能学习的可行性。
- 谓词发明是主要瓶颈(平均耗时4898秒),而技能学习较快(耗时372秒),表明符号发现是可扩展性的关键路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。