[论文解读] Sim2Real for Peg-Hole Insertion with Eye-in-Hand Camera
本文提出了一种基于端到端深度强化学习的仿真到现实(sim2real)迁移方法,用于基于眼在手RGB-D相机和本体感觉的插销-孔插入任务。策略在仿真环境中使用TD3算法进行训练,并直接部署到真实的UR5e机器人上,无需微调,尽管存在领域差距,仍实现了亚厘米级精度和55%的成功率。图像增强显著提升了性能,相较于原始RGB-D输入表现更优。
Even though the peg-hole insertion is one of the well-studied problems in robotics, it still remains a challenge for robots, especially when it comes to flexibility and the ability to generalize. Successful completion of the task requires combining several modalities to cope with the complexity of the real world. In our work, we focus on the visual aspect of the problem and employ the strategy of learning an insertion task in a simulator. We use Deep Reinforcement Learning to learn the policy end-to-end and then transfer the learned model to the real robot, without any additional fine-tuning. We show that the transferred policy, which only takes RGB-D and joint information (proprioception) can perform well on the real robot.
研究动机与目标
- 实现基于视觉的深度强化学习的零样本仿真到现实迁移,用于插销-孔插入任务。
- 探究图像增强和多模态感知输入(RGB-D、本体感觉)在提升仿真到现实泛化能力方面的有效性。
- 评估纯视觉、眼在手控制器是否能在无触觉反馈或真实世界微调的情况下实现精确插入。
- 在仿真中基准比较不同无模型强化学习算法(TD3、SAC、DDPG)并评估其在真实世界中的可迁移性。
- 理解深度感知在仿真到现实迁移中的局限性,以及本体感觉在策略性能中的作用。
提出的方法
- 使用深度确定性策略梯度(DDPG)及其改进版本TD3,在CoppeliaSim仿真环境中训练基于视觉的控制策略。
- 策略通过包含RGB-D图像和关节状态(本体感觉)的多模态观测空间进行端到端训练。
- 总奖励函数结合了距离、成功、碰撞和时间惩罚:R_total = R_distance + R_success + R_collision + R_time。
- 在训练过程中应用图像增强,以提升仿真到现实的可迁移性,尤其针对仅RGB输入的情况。
- 将训练好的策略直接部署到配备RealSense D435相机的真实UR5e机器人上,未进行任何真实世界微调。
- 采用基于经典计算机视觉(颜色分割与位姿估计)的基线方法进行对比。
实验结果
研究问题
- RQ1在仿真中训练的基于视觉的端到端深度强化学习策略,是否能在无需微调的情况下实现在真实机器人上的成功插销-孔插入?
- RQ2图像增强如何影响基于视觉的强化学习策略在仿真到现实迁移中的表现?
- RQ3深度图像(RGB-D)与仅RGB输入相比,对真实世界插入精度和成功率的贡献如何?
- RQ4本体感觉状态观测在仿真和真实世界部署中的策略性能中有多重要?
- RQ5为何RGB-D策略在仿真中训练成功,却在真实世界中无法泛化?
主要发现
- TD3算法在仿真中获得了最高回报,优于DDPG和SAC。
- 仅使用RGB输入并结合数据增强的模型在真实机器人上实现了55%的插入成功率,显著优于RGB-D变体。
- 使用增强的RGB-D模型完全失败(0%成功率),而未使用增强的模型表现极差(0%成功率,x方向平均误差为-124.1±166.9 mm)。
- 在仿真和真实世界部署中,本体感觉均未显著提升性能,表明该任务中其并非关键因素。
- 基线方法实现了100%的成功率,x方向平均误差为2.4±1.7 mm,y方向为0.3±3.0 mm,但依赖于经典计算机视觉而非学习方法。
- 图像增强对仿真到现实迁移至关重要,表明真实世界视觉差异(如光照和纹理)导致了领域差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。