Skip to main content
QUICK REVIEW

[论文解读] GraspARL: Dynamic Grasping via Adversarial Reinforcement Learning

Tianhao Wu, Fangwei Zhong|arXiv (Cornell University)|Mar 4, 2022
Robot Manipulation and Learning被引用 5
一句话总结

GraspARL 提出了一种对抗性强化学习框架,用于动态抓取,其中机器人与可移动物体在极小-极大博弈中协同训练,以提升策略的泛化能力。通过在对抗性生成的轨迹下训练机器人抓取物体,该方法在未见过的运动模式下表现出色,在真实世界的 Franka Panda 机器人上对复杂物体(如芥末瓶)实现了 80% 的成功率。

ABSTRACT

Grasping moving objects, such as goods on a belt or living animals, is an important but challenging task in robotics. Conventional approaches rely on a set of manually defined object motion patterns for training, resulting in poor generalization to unseen object trajectories. In this work, we introduce an adversarial reinforcement learning framework for dynamic grasping, namely GraspARL. To be specific. we formulate the dynamic grasping problem as a 'move-and-grasp' game, where the robot is to pick up the object on the mover and the adversarial mover is to find a path to escape it. Hence, the two agents play a min-max game and are trained by reinforcement learning. In this way, the mover can auto-generate diverse moving trajectories while training. And the robot trained with the adversarial trajectories can generalize to various motion patterns. Empirical results on the simulator and real-world scenario demonstrate the effectiveness of each and good generalization of our method.

研究动机与目标

  • 解决真实机器人中动态抓取策略在未见物体运动模式下的泛化挑战。
  • 克服模拟环境中手动设计轨迹的局限性,后者限制了对复杂或随机运动的泛化能力。
  • 开发一种自我改进的训练框架,在策略训练期间自动生成多样化、对抗性的物体轨迹。
  • 通过一种新型的物体几何感知奖励函数(OGAR)和碰撞惩罚,提升策略的鲁棒性和安全性。
  • 在无需领域随机化或任务特定微调的情况下,证明所学策略可成功迁移到真实世界机器人系统中。

提出的方法

  • 将动态抓取建模为机器人臂(抓取者)与对抗性移动者智能体之间的‘移动-抓取’极小-极大博弈。
  • 通过深度强化学习训练两个智能体,采用零和奖励结构,使移动者能够生成日益复杂且多样的轨迹。
  • 引入一种物体几何感知奖励(OGAR),引导机器人向最优抓取区域移动,同时惩罚碰撞。
  • 引入碰撞检测奖励,以提升训练过程中的安全性和策略稳定性。
  • 采用自上而下的抓取策略,并结合基于 UKF 的状态估计算法,以减少遮挡影响并提升跟踪鲁棒性。
  • 通过对抗性轨迹生成应用事后经验回放和课程学习,以加速策略收敛。

实验结果

研究问题

  • RQ1对抗性强化学习能否生成多样化、逼真的物体运动轨迹,从而提升动态抓取中的策略泛化能力?
  • RQ2与标准密集奖励相比,所提出的物体几何感知奖励(OGAR)在提升训练稳定性和抓取成功率方面有何增强作用?
  • RQ3对抗性训练在多大程度上提升了对未见运动模式(包括随机或复杂轨迹)的泛化能力?
  • RQ4训练后的策略是否能在无需领域随机化或微调的情况下成功迁移到真实世界机器人平台?
  • RQ5各组件(对抗学习、OGAR、碰撞检测)对整体性能的相对贡献如何?

主要发现

  • GraspARL 在真实世界动态抓取任务中,对芥末瓶的成功率达到 4/5(80%),对罐装肉食的抓取成功率为 3/5,实验平台为 Franka Panda 机器人。
  • 该方法在未见运动模式(包括随机、直线、正弦和圆形轨迹)下优于基线模型,成功率显著提升,且训练episode长度缩短。
  • 消融实验表明,对抗性训练对性能贡献最大;未使用对抗学习的模型成功率最低,episode长度最长。
  • 与标准密集奖励相比,物体几何感知奖励(OGAR)显著提升了训练稳定性和成功率,尤其在高速比条件下表现更优。
  • 碰撞检测奖励有助于提升策略安全性,即使在其他组件被移除的情况下,仍能减少episode长度并提高成功率。
  • 该方法在无需训练期间使用人工设计运动模式的情况下,能有效泛化至复杂、未见的轨迹,展现出有效的自动课程学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。