Skip to main content
QUICK REVIEW

[论文解读] Dynamic Handover: Throw and Catch with Bimanual Hands

Binghao Huang, Yuanpei Chen|arXiv (Cornell University)|Sep 11, 2023
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出动态手部交接(Dynamic Handover),一种使用双臂多指机械手(xArm 机器人上的 Allegro 手)在仿真环境中通过多智能体强化学习(MARL)实现高速抛接任务的双臂机器人系统,并完成仿真到现实的迁移。关键贡献是提出一种实时物体轨迹预测模型,实现动态闭环抓取,显著提升了在多样化物体上的真实世界实验成功率。

ABSTRACT

Humans throw and catch objects all the time. However, such a seemingly common skill introduces a lot of challenges for robots to achieve: The robots need to operate such dynamic actions at high-speed, collaborate precisely, and interact with diverse objects. In this paper, we design a system with two multi-finger hands attached to robot arms to solve this problem. We train our system using Multi-Agent Reinforcement Learning in simulation and perform Sim2Real transfer to deploy on the real robots. To overcome the Sim2Real gap, we provide multiple novel algorithm designs including learning a trajectory prediction model for the object. Such a model can help the robot catcher has a real-time estimation of where the object will be heading, and then react accordingly. We conduct our experiments with multiple objects in the real-world system, and show significant improvements over multiple baselines. Our project page is available at \url{https://binghao-huang.github.io/dynamic_handover/}.

研究动机与目标

  • 实现机器人在动态抛接任务中稳健、高速的双臂灵巧操作。
  • 解决双臂灵巧操作中高维动作空间、多样化物体动力学特性以及仿真到现实域差距的挑战。
  • 通过引入实时物体轨迹预测提升真实世界鲁棒性,实现自适应抓取。
  • 在未见物体上实现泛化能力,并在物理不确定性下保持稳定性能。
  • 通过端到端学习与仿真到现实迁移,建立动态双臂操作的新基准。

提出的方法

  • 训练一个双智能体强化学习(MARL)策略,由两个独立智能体(一个抛掷者,一个抓取者)协同完成高速双臂动作。
  • 在训练过程中应用广泛的物理随机化,包括摩擦力、惯性、质心位置和接触力,以提升策略的泛化能力和鲁棒性。
  • 引入一种学习型物体轨迹预测模型,实时估计物体未来位置,以闭环方式指导抓取者的策略。
  • 为每个智能体使用部分可观测信息,以增强策略鲁棒性并减小仿真到现实的域差距。
  • 通过系统辨识,对齐仿真与真实机器人硬件之间的 PD 控制器,实现成功的仿真到现实迁移。
  • 采用多阶段训练流程,以稳定策略学习并提升复杂动态任务中的收敛性。

实验结果

研究问题

  • RQ1多智能体强化学习能否有效协调两个灵巧手完成高速动态抛接任务?
  • RQ2实时物体轨迹预测在真实世界仿真到现实迁移中如何提升鲁棒性和成功率?
  • RQ3训练期间的物理随机化在多大程度上提升了对未见物体和真实世界动力学的泛化能力?
  • RQ4初始抓握质量如何影响抛掷的重复性和动态手部交接的成功率?
  • RQ5在真实世界环境中,MARL 与轨迹预测对整体系统性能的相对贡献如何?

主要发现

  • 在真实世界实验中,所提方法在球体上达到 60% 的成功率,圆柱体上为 53%,三角形上为 33%,显著优于所有消融实验基线。
  • 消融实验表明,若同时移除 MARL 和轨迹预测,三角形的成功率降至 0%,凸显两者缺一不可。
  • 所提方法在球体上的命中率达到 93%,表明其在预测物体轨迹和引导抓取者方面具有高精度。
  • 若移除 MARL,球体成功率降至 40%,圆柱体降至 20%,证明协同多智能体学习至关重要。
  • 若移除轨迹预测,球体成功率降至 33%,圆柱体为 40%,表明实时预测能显著提升适应性和鲁棒性。
  • 初始牢固抓握(Pose C)将落地点方差降低至 x 方向 0.024m,y 方向 0.043m,证明其在抛掷中具有更优的稳定性和可重复性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。