Skip to main content
QUICK REVIEW

[论文解读] Learning to Rearrange Deformable Cables, Fabrics, and Bags with Goal-Conditioned Transporter Networks

Daniel Seita, Pete Florence|arXiv (Cornell University)|Dec 6, 2020
Robot Manipulation and Learning参考文献 66被引用 12
一句话总结

本文提出了DeformableRavens,一个用于模拟和物理测试机器人对一维、二维和三维可变形物体(如电缆、织物和袋子)操作的基准。它提出了一种目标条件化的传送网络(Transporter Networks),该网络学习基于视觉的端到端多步操作,无需依赖真实姿态或顶点数据,在基于图像的目标条件下,物理实验中电缆重排任务的成功率达到70%。

ABSTRACT

Rearranging and manipulating deformable objects such as cables, fabrics, and bags is a long-standing challenge in robotic manipulation. The complex dynamics and high-dimensional configuration spaces of deformables, compared to rigid objects, make manipulation difficult not only for multi-step planning, but even for goal specification. Goals cannot be as easily specified as rigid object poses, and may involve complex relative spatial relations such as "place the item inside the bag". In this work, we develop a suite of simulated benchmarks with 1D, 2D, and 3D deformable structures, including tasks that involve image-based goal-conditioning and multi-step deformable manipulation. We propose embedding goal-conditioning into Transporter Networks, a recently proposed model architecture for learning robotic manipulation that rearranges deep features to infer displacements that can represent pick and place actions. In simulation and in physical experiments, we demonstrate that goal-conditioned Transporter Networks enable agents to manipulate deformable structures into flexibly specified configurations without test-time visual anchors for target locations. We also significantly extend prior results using Transporter Networks for manipulating deformable objects by testing on tasks with 2D and 3D deformables. Supplementary material is available at https://berkeleyautomation.github.io/bags/.

研究动机与目标

  • 解决在高维配置空间和模糊目标规范下操作可变形物体(如电缆、织物和袋子)的挑战。
  • 开发一种可泛化的基于视觉的方法,使机器人智能体能够在不依赖真实姿态或顶点信息的情况下学习可变形物体的多步操作。
  • 将先前的传送网络工作从一维可变形物体扩展到二维和三维可变形物体的操作任务,实现端到端学习。
  • 提供一个标准化的基准套件,以加速可变形结构机器人操作的研究。

提出的方法

  • 提出一个新的模拟基准DeformableRavens,包含12项任务,涉及一维(电缆)、二维(织物)和三维(袋子)可变形物体,包括基于图像的目标条件化。
  • 引入传送网络的目标条件化变体,将目标图像嵌入策略网络,以推断最优抓取与放置动作。
  • 采用基于视觉的端到端训练范式,模型处理RGB图像并基于目标与当前观测之间的特征传输预测动作。
  • 采用传送网络架构,学习将源区域(抓取点)的特征传输到目标区域(放置点),实现对可变形物体重排的精确控制。
  • 在物理实验中,基于电缆的局部切线线方向,采用启发式方法确定夹爪方向,以提高抓取可靠性。
  • 使用人类示范进行模仿学习训练,并通过独立的保留示范集进行验证,部署表现最佳的模型快照。

实验结果

研究问题

  • RQ1目标条件化的传送网络是否能在不依赖真实姿态或顶点数据的情况下,泛化到一维、二维和三维可变形物体的多步操作?
  • RQ2在仿真中训练的基于视觉的策略在现实世界中操作可变形电缆、织物和袋子时,其泛化性能如何?
  • RQ3基于图像的目标条件化是否能够实现灵活的、与任务无关的可变形物体操作,而无需显式姿态监督?
  • RQ4在袋子操作中,特别是在打开和提起阶段,主要的失败模式是什么?如何缓解这些问题?
  • RQ5基于视觉的模型性能与使用真实模拟姿态和顶点信息的基线方法相比如何?

主要发现

  • 目标条件化的传送网络在电缆重排任务中实现了10次物理实验中的7次成功,成功阈值为0.25的掩码交并比(IoU),证明了从仿真到现实的零样本迁移效果良好。
  • 每次成功实验平均仅需7次抓取与放置动作,表明策略在10次动作限制内执行高效。
  • 失败案例主要源于对自重叠电缆的抓取错误以及策略低效导致的重复动作,凸显了在遮挡条件下视觉感知与控制的挑战。
  • 在某些场景下,该方法优于使用真实姿态和顶点信息的基线模型,表明基于视觉的学习结合目标条件化,即使无显式状态监督,也能具备竞争力。
  • 基准DeformableRavens成功捕捉了从一维到三维可变形物体的多样化操作挑战,为未来方法的标准化评估提供了支持。
  • 物理实验确认,当结合启发式夹爪对齐策略时,模型在存在不完美抓取和传感器噪声的真实环境中仍具有良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。