Skip to main content
QUICK REVIEW

[论文解读] Search-Based Task Planning with Learned Skill Effect Models for Lifelong Robotic Manipulation

Jacky Liang, Mohit Sharma|arXiv (Cornell University)|Sep 17, 2021
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出了一种基于搜索的任务规划框架,利用学习到的技能效果模型(SEMs)实现机器人在新技能和新任务下的终身学习。通过迭代收集仿真数据并训练基于图神经网络的SEMs以预测技能结果和成本,该系统在无需微调的情况下即可在真实环境中高效规划,实现在未见过的任务和物体变化下的低成本计划与高成功率。

ABSTRACT

Robots deployed in many real-world settings need to be able to acquire new skills and solve new tasks over time. Prior works on planning with skills often make assumptions on the structure of skills and tasks, such as subgoal skills, shared skill implementations, or task-specific plan skeletons, which limit adaptation to new skills and tasks. By contrast, we propose doing task planning by jointly searching in the space of parameterized skills using high-level skill effect models learned in simulation. We use an iterative training procedure to efficiently generate relevant data to train such models. Our approach allows flexible skill parameterizations and task specifications to facilitate lifelong learning in general-purpose domains. Experiments demonstrate the ability of our planner to integrate new skills in a lifelong manner, finding new task strategies with lower costs in both train and test tasks. We additionally show that our method can transfer to the real world without further fine-tuning.

研究动机与目标

  • 实现机器人操作的终身学习,使新技能和新任务能够被逐步集成而无需重新训练整个系统。
  • 放宽先前对固定技能结构、共享嵌入或基于子目标的规划等假设的限制,以提升适应性。
  • 开发一种可扩展且数据高效的技能效果模型学习方法,使其在不同参数、物体特征和任务配置下具有良好的泛化能力。
  • 通过利用仿真到真实世界的迁移,实现在无需进一步微调的情况下将学习到的规划器部署于真实世界。

提出的方法

  • 该框架基于参数化技能元组进行基于搜索的规划,每个技能均关联一个学习到的技能效果模型(SEM),用于预测终端状态和执行成本。
  • SEMs采用图神经网络(GNN)架构训练,通过处理状态和技能参数输入来预测结果。
  • 通过迭代的数据收集循环,使用当前SEM在训练任务上运行规划器,生成用于再训练的相关技能执行数据。
  • 通过在收集的数据上训练新SEM来集成新技能,同时在新数据可用时对现有SEM进行微调。
  • 规划器利用SEM引导搜索过程,避免使用昂贵的实时仿真或硬编码模型。
  • 系统通过使用目标条件函数而非固定目标状态或嵌入,支持灵活的任务定义,从而实现对新任务的泛化。

实验结果

研究问题

  • RQ1任务规划器能否在无需重新训练整个系统的情况下,高效地将新技能集成到终身学习框架中?
  • RQ2学习到的技能效果模型在未见过的物体尺寸和物体数量(训练期间未出现)下,其泛化能力如何?
  • RQ3规划器能否在真实场景中实现低成本、高成功率的规划,而无需领域特定的微调?
  • RQ4当与SEMs结合时,学习到的先决条件模型在多大程度上提升了规划的成功率?
  • RQ5迭代式数据收集方案在多大程度上提升了样本效率和模型性能,且随时间推移表现如何改善?

主要发现

  • 与随机规划器相比,该规划器在测试任务上的平均成本显著更低,规划时间提速达10倍。
  • 系统在无需微调的情况下成功迁移到真实世界,展示了对未见过的任务和物体配置的稳健泛化能力。
  • 在任务B(将红方块放入托盘)中,采用Pick-Place + Tray Slide组合时,使用学习到的先决条件模型可实现平均成本4.35,成功率90%。
  • SEMs在不同物体尺寸上泛化良好:2cm、3cm和4cm方块的平均成本分别保持在6.56以内,性能下降极小。
  • 系统对不同数量的物体也具有泛化能力——例如,1个或2个红方块时,仅使用Pick-Place的平均成本分别为1.91和4.33。
  • 学习到的先决条件模型在Pick-Place任务中实现96%的成功率,在Pick-Place + Tray Slide任务中实现90%的成功率,表明其对技能执行的预测具有高度可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。