Skip to main content
QUICK REVIEW

[论文解读] DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools

Xingyu Lin, Zhiao Huang|arXiv (Cornell University)|Mar 31, 2022
Robot Manipulation and Learning被引用 14
一句话总结

DiffSkill 提出了一种框架,利用可微分物理模拟器自动抽象出可重用技能,以实现对柔性物体的长时程工具操作。通过在基于梯度的优化生成的演示轨迹上训练神经技能抽象器,并基于 RGB-D 观测对这些抽象技能进行规划,该方法在复杂面团操作任务中优于基于模型的强化学习和独立轨迹优化方法。

ABSTRACT

We consider the problem of sequential robotic manipulation of deformable objects using tools. Previous works have shown that differentiable physics simulators provide gradients to the environment state and help trajectory optimization to converge orders of magnitude faster than model-free reinforcement learning algorithms for deformable object manipulation. However, such gradient-based trajectory optimization typically requires access to the full simulator states and can only solve short-horizon, single-skill tasks due to local optima. In this work, we propose a novel framework, named DiffSkill, that uses a differentiable physics simulator for skill abstraction to solve long-horizon deformable object manipulation tasks from sensory observations. In particular, we first obtain short-horizon skills using individual tools from a gradient-based optimizer, using the full state information in a differentiable simulator; we then learn a neural skill abstractor from the demonstration trajectories which takes RGBD images as input. Finally, we plan over the skills by finding the intermediate goals and then solve long-horizon tasks. We show the advantages of our method in a new set of sequential deformable object manipulation tasks compared to previous reinforcement learning algorithms and compared to the trajectory optimizer.

研究动机与目标

  • 解决使用工具对柔性物体进行长时程、多阶段操作的挑战,该任务对基于梯度的优化器而言困难,因其易陷入局部最优。
  • 克服可微分物理模拟器的局限性,即需要完整状态信息且仅适用于短时程任务。
  • 通过直接从 RGB-D 观测学习技能抽象,而非依赖完整模拟器状态,实现真实场景下的泛化能力。
  • 开发一种方法,用于组合抽象技能,以完成复杂且顺序性的任务,如抓取、摊开、聚集、运输、切割和重新排列面团。
  • 弥合可微分物理的高样本效率与长时程机器人操作中对分层规划的需求之间的差距。

提出的方法

  • 在可微分物理模拟器中使用基于梯度的轨迹优化器,利用完整模拟器状态生成短时程、单技能任务的专家演示轨迹。
  • 训练一个神经技能抽象器作为目标条件策略,将 RGB-D 图像映射到技能嵌入,模仿演示轨迹。
  • 通过在技能嵌入的潜在空间中规划中间目标,将长时程任务分解为一系列技能。
  • 使用可行性预测器优化中间目标,该预测器评估从两个潜在状态之间通过某项技能实现转移是否可行。
  • 通过搜索能导致任务完成的连续目标序列,对抽象技能执行离散规划,从而实现分层控制。
  • 在训练期间利用可微分模拟器生成多样化且高质量的演示数据以支持技能学习,而推理阶段仅依赖视觉观测。

实验结果

研究问题

  • RQ1可微分物理模拟器能否用于自动发现复杂、长时程柔性物体操作中的可重用技能?
  • RQ2如何使可微分物理中的技能抽象与视觉观测(RGB-D)兼容,以提升真实场景下的泛化能力?
  • RQ3在长时程任务中,对抽象技能进行规划是否能显著优于端到端强化学习和直接轨迹优化?
  • RQ4基于梯度的优化用于技能获取与潜在空间规划相结合,如何提升柔性物体操作中的样本效率和任务成功率?
  • RQ5使用仿真数据训练的神经技能抽象器在泛化到未见场景或真实世界部署时存在哪些局限性?

主要发现

  • DiffSkill 在柔性面团上成功解决了三个具有挑战性的长时程顺序操作任务——LiftSpread、GatherTransport 和 CutRearrange,使用了工具。
  • 该方法在所有评估任务中均优于基于模型的强化学习基线,表现出更高的样本效率和成功率。
  • DiffSkill 的任务成功率高于独立的基于梯度的轨迹优化器,后者在长时程设置下因陷入局部最优而失败。
  • 神经技能抽象器能从 RGB-D 观测中良好泛化,使智能体在无法访问完整模拟器状态的情况下仍能进行规划。
  • 可行性预测器通过隐式建模潜在空间中的技能动态,实现了对技能序列的有效离散规划。
  • 实验表明,可微分物理用于技能生成与分层规划相结合,能够实现对复杂柔性材料的鲁棒且可扩展的操作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。