[论文解读] Dynamics and Domain Randomized Gait Modulation with Bezier Curves for Sim-to-Real Legged Locomotion
本文提出 D2-GMBC,一种基于动力学与领域随机化的仿真到现实强化学习框架,用于调节四足机器人的贝塞尔曲线基步态。该策略仅在仿真中使用惯性测量进行训练,即可实现对未知粗糙地形的稳健穿越——相比非随机化训练,生存距离提升 5.6 倍;在真实机器人上性能提升 4.28 倍,且无需接触传感或真实世界微调。
We present a sim-to-real framework that uses dynamics and domain randomized offline reinforcement learning to enhance open-loop gaits for legged robots, allowing them to traverse uneven terrain without sensing foot impacts. Our approach, D$^2$-Randomized Gait Modulation with Bezier Curves (D$^2$-GMBC), uses augmented random search with randomized dynamics and terrain to train, in simulation, a policy that modifies the parameters and output of an open-loop Bezier curve gait generator for quadrupedal robots. The policy, using only inertial measurements, enables the robot to traverse unknown rough terrain, even when the robot's physical parameters do not match the open-loop model. We compare the resulting policy to hand-tuned Bezier Curve gaits and to policies trained without randomization, both in simulation and on a real quadrupedal robot. With D$^2$-GMBC, across a variety of experiments on unobserved and unknown uneven terrain, the robot walks significantly farther than with either hand-tuned gaits or gaits learned without domain randomization. Additionally, using D$^2$-GMBC, the robot can walk laterally and rotate while on the rough terrain, even though it was trained only for forward walking.
研究动机与目标
- 使四足机器人在不感知足部撞击的情况下穿越未建模的粗糙地形。
- 通过在仿真中对动力学和地形进行随机化训练策略,弥合足式运动中的仿真到现实差距。
- 利用强化学习增强开环贝塞尔曲线步态,以提升鲁棒性与适应性。
- 仅通过训练前向行走的单一策略,实现全向运动(前进、侧向、旋转)。
- 在极小的真实世界数据依赖下实现高性能,完全依赖仿真与领域随机化。
提出的方法
- 该方法使用包含 12 个控制点的贝塞尔曲线步态生成器来定义足部轨迹,由 τ 和 ψ 参数化。
- 通过增强随机搜索(ARS)训练的强化学习策略,仅使用惯性测量实时调节步态参数(τ, ψ)。
- 训练过程中在动力学(如惯性、摩擦)和地形属性(如表面粗糙度、坡度)上应用领域随机化,以提升仿真到现实的泛化能力。
- 通过外部转向指令训练策略,实现无需额外训练即可实现侧向与旋转运动。
- 系统采用相位锁定时钟机制,基于前左腿撞击时间同步腿部轨迹,通过设置相位延迟以生成奔跑步态。
- 该方法完全避免接触传感,仅依赖惯性反馈实时调整步态参数。
实验结果
研究问题
- RQ1在仿真中通过领域随机化训练的策略是否能在无接触传感的情况下泛化到真实世界的粗糙地形?
- RQ2同时对动力学与地形进行随机化,是否相比仅随机化动力学能更有效地提升仿真到现实的迁移性能?
- RQ3仅针对前向行走训练的策略是否能无需额外训练即实现侧向行走与旋转运动?
- RQ4在仿真与真实世界测试中,D2-GMBC 与人工调校的步态及非随机化学习基线相比性能如何?
- RQ5该方法在保持平坦地面上前向速度的同时,能在多大程度上实现不平地形下的鲁棒性?
主要发现
- 在仿真中,D2-GMBC 在随机粗糙地形上的生存距离(≥90m)相比非随机化训练基线提升 5.6 倍,尽管训练期间性能更差。
- 在真实机器人上,D2-GMBC 实现的行进距离比人工调校的贝塞尔曲线步态高出 4.28 倍,即使在与仿真网格显著不同的松散石块地形上亦然。
- 该策略成功实现了在粗糙地形上的侧向行走与旋转运动,尽管仅针对前向行走进行训练,表明其对新运动指令具有泛化能力。
- 该方法在平坦地面上保持了全向运动速度,表明在标准地面上性能未下降。
- 该策略在少于 600 次训练周期内即实现鲁棒性能,展示了仿真中的数据效率。
- 该框架可实现无需真实世界微调的直接仿真到现实部署,仅依赖惯性测量,无需地形或接触传感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。