[论文解读] Closing the Sim2Real Gap in Dynamic Cloth Manipulation.
本文提出了一种零样本强化学习方法,用于在模拟环境中通过视觉反馈和材料属性随机化实现动态布料操作,使策略能够在不进行微调的情况下泛化到现实世界中的布料操作。该方法仅使用视觉观测和随机化的物理属性,成功将模拟环境中训练的策略迁移到真实世界任务中。
Cloth manipulation is a challenging task due to the many degrees of freedom and properties of the material affecting the dynamics of the cloth. The nonlinear dynamics of the cloth have particularly strong significance in dynamic cloth manipulation, where some parts of the cloth are not directly controllable. In this paper, we present a novel approach for solving dynamic cloth manipulation by training policies using reinforcement learning (RL) in simulation and transferring the learned policies to the real world in a zero-shot manner. The proposed method uses visual feedback and material property randomization in a physics simulator to achieve generalization in the real world. Experimental results show that using only visual feedback is enough for the policies to learn the dynamic manipulation task in a way that transfers from simulation to the real world. In addition, the randomization of the dynamics in simulation enables capturing the behavior of a variety of cloths in the real world.
研究动机与目标
- 解决动态布料操作中的模拟到现实差距问题,其中非线性动力学和高自由度使控制复杂化。
- 实现在不进行真实世界微调的情况下,将策略从模拟环境零样本迁移到现实世界。
- 探究仅使用视觉反馈是否能够有效支持复杂布料动力学的策略学习。
- 评估材料属性随机化在模拟多样化真实世界布料行为方面的有效性。
提出的方法
- 在仅使用视觉反馈、不依赖状态或位姿监督的物理模拟器中使用强化学习训练策略。
- 在模拟中对材料属性(例如,刚度、摩擦系数)应用随机化,以提高鲁棒性和泛化能力。
- 使用可微分物理引擎,模拟具有高保真度形变和交互作用的真实布料动力学。
- 基于视觉观测差异设计奖励函数,引导策略学习朝向期望的布料构型。
- 采用领域随机化技术,在训练期间模拟光照、纹理和材料属性的变化。
实验结果
研究问题
- RQ1仅使用视觉反馈是否能够在模拟环境中有效支持动态布料操作的策略学习?
- RQ2在模拟中对材料属性进行随机化是否能提升向真实世界布料操作的零样本迁移性能?
- RQ3在模拟中训练的策略在多大程度上能泛化到不同种类的真实世界布料?
- RQ4缺乏状态或位姿监督在模拟到现实迁移中对策略性能有何影响?
主要发现
- 仅使用视觉反馈训练的策略成功实现了从模拟到真实世界的零样本迁移。
- 材料属性随机化显著提升了在不同真实世界布料类型上的泛化能力。
- 该方法在无需真实世界微调的情况下,成功实现了对多种布料的动态操作。
- 该方法在真实部署中对布料刚度、摩擦系数和纹理的变化表现出良好的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。