[论文解读] Circus ANYmal: A Quadruped Learning Dexterous Manipulation with Its Limbs
本论文首次在真实世界中展示了通过无模型深度强化学习,利用四足机器人ANYmal的全部四条肢体实现灵巧的动态操作。该策略在仿真环境中通过随机化训练以增强鲁棒性,实现了无需现实世界微调的零样本部署,在持续操作中实现了高达15°/s的球体旋转速度,并能从外部干扰中稳健恢复。
Quadrupedal robots are skillful at locomotion tasks while lacking manipulation skills, not to mention dexterous manipulation abilities. Inspired by the animal behavior and the duality between multi-legged locomotion and multi-fingered manipulation, we showcase a circus ball challenge on a quadrupedal robot, ANYmal. We employ a model-free reinforcement learning approach to train a deep policy that enables the robot to balance and manipulate a light-weight ball robustly using its limbs without any contact measurement sensor. The policy is trained in the simulation, in which we randomize many physical properties with additive noise and inject random disturbance force during manipulation, and achieves zero-shot deployment on the real robot without any adjustment. In the hardware experiments, dynamic performance is achieved with a maximum rotation speed of 15 deg/s, and robust recovery is showcased under external poking. To our best knowledge, it is the first work that demonstrates the dexterous dynamic manipulation on a real quadrupedal robot.
研究动机与目标
- 使四足机器人能够使用全部四条肢体执行灵巧的动态操作,模拟动物般的操作技能。
- 克服在缺乏接触传感器或接触动力学先验知识的情况下,训练完整肢体操作策略的挑战。
- 实现仿真策略在真实四足机器人上的零样本部署,且无需现实世界适应即可保持鲁棒性能。
- 通过强化学习探索行走与操作之间的双重性,特别是在奖励设计和控制策略方面。
提出的方法
- 采用无模型深度强化学习方法在仿真环境中训练策略,不依赖接触动力学或传感器反馈的先验知识。
- 使用奖励函数进行训练,该函数强调在滚动、俯仰和偏航方向上跟踪目标角速度,并对过度控制努力施加惩罚。
- 通过随机化物理属性(如质量、摩擦、阻尼)以及在训练期间注入随机干扰力,增强对仿真到现实差异的鲁棒性。
- 仅使用关节本体感觉反馈——不依赖外部接触传感器或视觉——使该方法适用于现实世界部署。
- 策略被训练为仅使用脚部操控一个轻质马戏球,同时保持机器人本体不接触球体。
- 该方法利用多足行走与多指操作之间的固有双重性,复用行走控制原理以实现操作控制。
实验结果
研究问题
- RQ1四足机器人是否能学会在无专用操作器或接触传感器的情况下,仅使用全部四条肢体实现灵巧的动态操作?
- RQ2如何在仿真环境中训练深度强化学习策略,以实现在真实四足机器人上对操作任务的鲁棒零样本部署?
- RQ3与标准行走奖励函数相比,哪些奖励塑造策略在动态操作任务中更为有效?
- RQ4缺乏接触传感如何影响基于肢体的操作策略学习与鲁棒性?
主要发现
- 该策略在真实ANYmal机器人上实现了无需任何现实世界微调的零样本部署,展示了强大的仿真到现实泛化能力。
- 机器人成功实现了超过2分钟的连续动态操作,稳定维持高达15°/s的球体旋转速度。
- 控制器在主动操作过程中对如戳击等外部干扰表现出稳健的恢复能力。
- 基于目标速度跟踪的奖励设计优于直接基于速度的奖励,在复杂接触场景中表现更优。
- 该方法成功利用了行走与操作之间的双重性,表明共享控制原则可应用于全肢体操作。
- 缺乏接触传感器并未影响性能,因为策略完全依赖关节本体感觉和学习到的接触动力学。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。