[论文解读] Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning
该论文展示了深度强化学习(Deep RL)能够通过仿真环境中的端到端训练,实现零样本迁移至真实硬件,使低成本、小型化人形机器人学会敏捷、动态且安全的足球技能,如行走、踢球、跌倒恢复和策略性比赛。智能体在1v1足球环境中实现了优于脚本基线的性能,包括行走速度提升156%,跌倒后恢复速度提升63%,踢球速度提升24%,并能无缝组合各项技能。
We investigate whether Deep Reinforcement Learning (Deep RL) is able to synthesize sophisticated and safe movement skills for a low-cost, miniature humanoid robot that can be composed into complex behavioral strategies in dynamic environments. We used Deep RL to train a humanoid robot with 20 actuated joints to play a simplified one-versus-one (1v1) soccer game. The resulting agent exhibits robust and dynamic movement skills such as rapid fall recovery, walking, turning, kicking and more; and it transitions between them in a smooth, stable, and efficient manner. The agent's locomotion and tactical behavior adapts to specific game contexts in a way that would be impractical to manually design. The agent also developed a basic strategic understanding of the game, and learned, for instance, to anticipate ball movements and to block opponent shots. Our agent was trained in simulation and transferred to real robots zero-shot. We found that a combination of sufficiently high-frequency control, targeted dynamics randomization, and perturbations during training in simulation enabled good-quality transfer. Although the robots are inherently fragile, basic regularization of the behavior during training led the robots to learn safe and effective movements while still performing in a dynamic and agile way -- well beyond what is intuitively expected from the robot. Indeed, in experiments, they walked 181% faster, turned 302% faster, took 63% less time to get up, and kicked a ball 34% faster than a scripted baseline, while efficiently combining the skills to achieve the longer term objectives.
研究动机与目标
- 探究深度强化学习是否能够为低成本双足机器人在动态环境中合成复杂、安全且动态的运动技能。
- 实现通过分层技能训练和自博弈(self-play)实现端到端的复合行为学习,如行走、踢球和跌倒恢复。
- 在存在硬件差异和未建模动力学的情况下,实现有效的零样本从仿真到真实人形机器人的迁移。
- 探索基于视觉的控制方法,利用机载摄像头和时间序列整合,减少对动作捕捉系统的依赖。
- 评估是否能从简单的奖励设计中自然涌现出策略性行为,如预判球的运动轨迹和阻挡射门。
提出的方法
- 在具有20个执行器关节的1v1足球仿真环境中,单独使用深度强化学习训练跌倒恢复和射门等技能。
- 通过自博弈方式将这些技能组合并蒸馏为单一策略,其中智能体与自身早期版本对战以提升战术行为。
- 在仿真训练期间应用高频控制、目标动力学随机化以及随机力扰动,以提升鲁棒性及仿真到真实世界的迁移效果。
- 采用基于NeRF的视觉仿真,结合随机化的NeRF以及叠加的动态物体(球和对手),以弥合视觉智能体在仿真与真实世界之间的差距。
- 采用基于LSTM的智能体处理序列视觉观测,从部分的、第一视角的摄像头画面中推断状态信息。
- 使用稀疏奖励函数优化策略,重点聚焦于进球和阻挡对手,对个体动作未使用密集奖励。

实验结果
研究问题
- RQ1深度强化学习能否训练低成本人形机器人,使其在真实足球比赛中掌握复杂、动态且安全的运动技能?
- RQ2通过自博弈方法,孤立技能(如跌倒恢复、踢球)在多大程度上可被整合为统一的高层策略?
- RQ3在使用高频控制和基于扰动的领域随机化时,零样本从仿真到真实机器人的迁移效果如何?
- RQ4基于视觉的智能体是否能仅依靠机载摄像头和时间记忆,有效追踪球并合理定位自身?
- RQ5是否能从简单的奖励函数中自然涌现出策略性行为,如预判球的运动轨迹或阻挡射门?
主要发现
- 真实机器人行走速度比脚本基线快156%,表明学习策略带来了显著的性能提升。
- 跌倒后恢复时间相比脚本基线减少了63%,表明对动态干扰具有鲁棒且高效的恢复能力。
- 踢球速度比基线提升24%,显示出在物体交互中具备更高的敏捷性和动态控制能力。
- 在基于视觉的点球试验中,智能体10次射门中进了6次(60%),击中门柱3次(30%),证明其具备有效的视觉状态推断与动作规划能力。
- 智能体学会了预判球的运动轨迹并阻挡对手射门,表明在未显式为这些行为设计奖励的情况下,已自然涌现出基本战术理解。
- 尽管硬件脆弱,但通过训练期间的微小调整和行为正则化,仍实现了安全、动态且高效的现实世界执行。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。