[论文解读] Adversarial Discriminative Sim-to-real Transfer of Visuo-motor Policies
本文提出了一种对抗性判别式迁移(ADT)方法,用于使用少量标注的真实图像和无标注的真实数据,实现视觉-运动策略的仿真到现实的迁移。通过将生成对抗网络与模块化深度Q网络相结合,该方法将标注真实数据的需求减少了50%,在7自由度机械臂抓取任务中仅使用93张标注图像和186张无标注真实图像,即实现了97.8%的成功率和1.8厘米的控制精度。
Various approaches have been proposed to learn visuo-motor policies for real-world robotic applications. One solution is first learning in simulation then transferring to the real world. In the transfer, most existing approaches need real-world images with labels. However, the labelling process is often expensive or even impractical in many robotic applications. In this paper, we propose an adversarial discriminative sim-to-real transfer approach to reduce the cost of labelling real data. The effectiveness of the approach is demonstrated with modular networks in a table-top object reaching task where a 7 DoF arm is controlled in velocity mode to reach a blue cuboid in clutter through visual observations. The adversarial transfer approach reduced the labelled real data requirement by 50%. Policies can be transferred to real environments with only 93 labelled and 186 unlabelled real images. The transferred visuo-motor policies are robust to novel (not seen in training) objects in clutter and even a moving target, achieving a 97.8% success rate and 1.8 cm control accuracy.
研究动机与目标
- 解决机器人视觉-运动策略学习中真实世界数据标注成本过高的问题。
- 降低在仿真到现实迁移中对大规模标注真实数据的依赖。
- 通过最小量的标注真实图像和丰富的无标注真实数据,实现在真实环境中的鲁棒策略迁移。
- 验证对抗性域适应在视觉-运动控制回归任务中的有效性。
- 验证模块化神经网络架构在复杂机器人任务中的可扩展性和鲁棒性。
提出的方法
- 提出一种对抗性判别式迁移(ADT)框架,利用类似生成对抗网络(GAN)的判别器,对齐仿真与真实观测之间的特征。
- 在仿真环境中使用领域随机化训练感知模块,然后通过对抗损失最小化将其适应到真实世界数据。
- 集成模块化深度Q网络(DQN)架构,使感知与控制模块通过加权损失联合端到端微调。
- 使用少量标注的真实图像(最少48张)结合最多两倍数量的无标注真实图像,训练判别器并优化策略预测。
- 在推理过程中应用PI控制器以稳定策略输出,提升对视觉和动态变化的鲁棒性。
- 实施加权端到端微调,通过在适应过程中强调高置信度预测来提升性能。
实验结果
研究问题
- RQ1对抗性判别式迁移能否减少仿真到现实视觉-运动策略迁移对标注真实图像的需求?
- RQ2所提出的ADT方法在仅使用极少真实数据的情况下,将仿真中训练的策略迁移到真实世界机器人操作任务中的有效性如何?
- RQ3模块化网络架构在杂乱环境中对新型干扰物和运动目标的鲁棒性提升程度如何?
- RQ4与纯领域随机化相比,领域随机化与对抗性适应结合在数据效率和性能方面表现如何?
- RQ5ADT框架能否扩展至极少量标注真实数据的少样本仿真到现实迁移?
主要发现
- 对抗性判别式迁移(ADT)方法相比监督适应,将所需标注真实图像数量减少了50%,同时实现了相当的性能表现。
- 仅使用93张标注图像和186张无标注真实图像,该方法在7自由度机械臂抓取任务中实现了97.8%的成功率和1.8厘米的中位控制误差。
- 该方法对新型干扰物甚至运动目标保持了鲁棒性,展示了对训练分布之外情况的泛化能力。
- 采用加权损失的端到端微调使策略精度相比初始迁移提升了37.9%,凸显了联合优化的重要性。
- 仅使用48张标注真实图像即实现了97.8%的成功率,表明在数据稀缺环境下具备强大的少样本仿真到现实迁移潜力。
- 模块化架构仅使用30,225条仿真轨迹和333个真实数据样本(93张标注,186张无标注)即实现有效迁移,在数据效率方面优于纯领域随机化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。