Skip to main content
QUICK REVIEW

[论文解读] Learning to Compose Hierarchical Object-Centric Controllers for Robotic Manipulation

Mohit Sharma, Jacky Liang|arXiv (Cornell University)|Nov 9, 2020
Robot Manipulation and Learning被引用 8
一句话总结

本文提出一种基于强化学习(RL)的方法,用于动态组合分层的、以物体为中心的控制器,以解决机器人操作任务。通过学习一系列按顺序排列的任务轴控制器——每个控制器均相对于环境中的物体定义,并通过空投影(nullspace projection)组合——该方法实现了更高的样本效率,对未见过的环境实现了零样本泛化,并在四个仿真和真实世界任务中实现了无需微调的仿真到现实世界的迁移。

ABSTRACT

Manipulation tasks can often be decomposed into multiple subtasks performed in parallel, e.g., sliding an object to a goal pose while maintaining contact with a table. Individual subtasks can be achieved by task-axis controllers defined relative to the objects being manipulated, and a set of object-centric controllers can be combined in an hierarchy. In prior works, such combinations are defined manually or learned from demonstrations. By contrast, we propose using reinforcement learning to dynamically compose hierarchical object-centric controllers for manipulation tasks. Experiments in both simulation and real world show how the proposed approach leads to improved sample efficiency, zero-shot generalization to novel test environments, and simulation-to-reality transfer without fine-tuning.

研究动机与目标

  • 为解决使用模块化、以物体为中心的控制器在机器人操作中组合多个并行子任务的挑战。
  • 实现动态、学习得到的控制器层级选择,而非依赖人工设计或人类示范。
  • 通过结构化的分层控制器组合,提升复杂操作任务中的样本效率和泛化能力。
  • 在不使用领域随机化或微调的情况下,实现鲁棒的仿真到现实世界的迁移。
  • 通过基于物体的控制引入归纳偏置,增强策略对物体属性(如尺寸)变化的不变性。

提出的方法

  • 该方法使用强化学习策略选择一组按顺序排列的低层级物体轴控制器,每个控制器均相对于特定物体或几何特征(例如,表面法线、指向物体的方向)定义。
  • 控制器通过空投影组合,其中低优先级控制器被投影到高优先级控制器的空空间中,以防止相互干扰。
  • 动作空间被构建成控制器的分层结构,支持并行执行子任务(如定位和力的施加)。
  • 该方法采用扩展的马尔可夫决策过程(MDP)公式,允许更长的控制器执行周期(T步),从而提高样本效率。
  • 策略在仿真环境中训练,并在仿真和真实世界任务中进行评估,包括积木拼合、推动、拧螺丝和开门任务。
  • 该方法实现了对新型环境配置的零样本泛化,以及无需额外微调的仿真到现实世界的迁移。

实验结果

研究问题

  • RQ1强化学习策略能否动态学习组合多个以物体为中心的控制器,以解决复杂操作任务?
  • RQ2通过空投影实现的分层组合是否能有效防止并发子任务之间的干扰?
  • RQ3所学习的控制器选择策略能否在不进行微调的情况下泛化到新型环境配置?
  • RQ4与固定或单控制器策略相比,该方法是否实现了更好的样本效率?
  • RQ5该策略能否在不使用领域随机化或微调的情况下实现从仿真到真实世界的迁移?

主要发现

  • 所提出的方法在仿真环境中块状拼合任务上的成功率达到了0.99(±0.01),训练曲线仅需30K步,显著快于基线方法在T=10时所需的1000万步。
  • 该方法在新型测试环境配置下展示了零样本泛化能力,在Franka开门任务中,仿真环境下的成功率为1.00,真实世界测试中的成功率为0.99(±0.01)。
  • 控制器选择策略学会了跨不同物体组合控制器,例如选择一面墙作为主要定位,另一面墙作为次要对齐。
  • 由于控制器基于物体相对位置,策略对物体属性(如尺寸)的变化表现出鲁棒性。
  • 该方法在真实机器人任务(如拧螺丝和开门)中实现了仿真到现实世界的迁移,无需任何微调,成功率分别为0.99(±0.01)和0.93(±0.03)。
  • 消融实验表明,增加控制器执行周期(T=80)可提升样本效率,而单控制器策略在高T值下表现较差,凸显了并行控制器组合的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。