Skip to main content
QUICK REVIEW

[论文解读] VisuoSpatial Foresight for Multi-Step, Multi-Task Fabric Manipulation

Ryan Hoque, Daniel Seita|arXiv (Cornell University)|Mar 19, 2020
3D Shape Modeling and Analysis参考文献 62被引用 20
一句话总结

本文提出了视觉空间前瞻(VisuoSpatial Foresight, VSF),一种通过在模拟环境中对领域随机化的RGB和深度数据进行视觉前瞻学习而获得的目标条件策略,实现了无需任务示范的多步布料抚平与折叠。与仅使用RGB相比,使用RGBD在折叠任务上的成功率提升了80%,并且能够有效迁移到真实的dVRK外科机器人上,在物理抚平任务中比模仿学习高出2%。

ABSTRACT

Robotic fabric manipulation has applications in home robotics, textiles, senior care and surgery. Existing fabric manipulation techniques, however, are designed for specific tasks, making it difficult to generalize across different but related tasks. We extend the Visual Foresight framework to learn fabric dynamics that can be efficiently reused to accomplish different fabric manipulation tasks with a single goal-conditioned policy. We introduce VisuoSpatial Foresight (VSF), which builds on prior work by learning visual dynamics on domain randomized RGB images and depth maps simultaneously and completely in simulation. We experimentally evaluate VSF on multi-step fabric smoothing and folding tasks against 5 baseline methods in simulation and on the da Vinci Research Kit (dVRK) surgical robot without any demonstrations at train or test time. Furthermore, we find that leveraging depth significantly improves performance. RGBD data yields an 80% improvement in fabric folding success rate over pure RGB data. Code, data, videos, and supplementary material are available at https://sites.google.com/view/fabric-vsf/.

研究动机与目标

  • 在无需任务特定示范的情况下,实现对多样化、长时程布料操作任务(如抚平和折叠)的泛化。
  • 通过利用领域随机化模拟和多模态传感,解决布料操作中数据需求高和现实世界迁移困难的问题。
  • 通过将深度信息整合到视觉前瞻中,提升动态建模的准确性,从而提高策略性能和鲁棒性。
  • 仅使用视觉输入且无需在真实世界进行微调,实现单一学习策略在真实机器人系统上的零样本迁移。

提出的方法

  • 在领域随机化的布料模拟环境中,仅使用RGB和深度输入,对完全随机交互数据训练视频预测模型。
  • 使用基于学习的视觉动态模型进行模型预测控制(MPC),生成用于布料操作的目标条件动作。
  • 利用领域随机化提升仿真到现实的迁移能力,减少仿真到现实的领域差距,以实现物理部署。
  • 通过在学习的视觉-空间动态模型上进行规划,定义目标条件策略,实现对新目标的零样本适应。
  • 使用条件高斯采样结合交叉熵方法(CEM)优化动作序列,偏好精确、小幅度的动作。
  • 在仿真环境和真实dVRK机器人上评估策略,仅使用实时RGB图像,且在整个训练和推理过程中均未使用任何真实世界示范数据。

实验结果

研究问题

  • RQ1在仿真环境中仅通过随机交互数据训练的单一目标条件策略,是否能无需任务特定示范即泛化到多种多步布料操作任务(如抚平和折叠)?
  • RQ2在视觉前瞻中引入深度信息如何影响布料操作任务中的性能和鲁棒性?
  • RQ3在仿真环境中仅基于完全随机交互数据训练的策略,能否在无需真实世界微调的情况下成功迁移到真实世界机器人系统(如dVRK)?
  • RQ4与模仿学习相比,视觉-空间动态建模是否能提升高精度布料任务中的精度和成功率?
  • RQ5策略的动作选择策略(如小幅度与大幅度变化)如何影响复杂可变形物体操作中的性能和鲁棒性?

主要发现

  • 在仿真中,使用RGBD数据的VSF策略相比仅使用RGB数据,折叠成功率提升了80%。
  • 在真实的dVRK机器人上,尽管训练和推理过程中均未访问任务示范,VSF策略在布料抚平任务中的成功率仍比模仿学习基线高出2%。
  • 该策略成功迁移到真实机器人,并在回放真实动作时于仿真中生成了合理的折叠结果,表明主要失败原因在于动态模型不匹配,而非策略本身的问题。
  • VSF策略生成的动作增量比模仿学习基线更小、更精确,降低了覆盖布料角落的风险,提升了长期任务的稳定性。
  • 引入深度信息显著提升了视觉前瞻的性能,表明多模态传感对于复杂布料操作中准确动态建模至关重要。
  • 动作增量的直方图显示,VSF的动作始终更小、更受控,有助于避免高幅度策略中常见的反效果运动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。