[论文解读] Guided Curriculum Learning for Walking Over Complex Terrain
本文提出了一种三阶段引导式课程学习框架,用于训练深度强化学习策略,使双足机器人能够在复杂地形(如缝隙、障碍物、台阶和阶梯)上行走。通过逐步提高地形难度、减少引导力并引入逐步增强的扰动,该方法在仅使用简单手工设计的行走轨迹作为先验的前提下,无需人类示范即可实现鲁棒且高性能的策略。
Reliable bipedal walking over complex terrain is a challenging problem, using a curriculum can help learning. Curriculum learning is the idea of starting with an achievable version of a task and increasing the difficulty as a success criteria is met. We propose a 3-stage curriculum to train Deep Reinforcement Learning policies for bipedal walking over various challenging terrains. In the first stage, the agent starts on an easy terrain and the terrain difficulty is gradually increased, while forces derived from a target policy are applied to the robot joints and the base. In the second stage, the guiding forces are gradually reduced to zero. Finally, in the third stage, random perturbations with increasing magnitude are applied to the robot base, so the robustness of the policies are improved. In simulation experiments, we show that our approach is effective in learning walking policies, separate from each other, for five terrain types: flat, hurdles, gaps, stairs, and steps. Moreover, we demonstrate that in the absence of human demonstrations, a simple hand designed walking trajectory is a sufficient prior to learn to traverse complex terrain types. In ablation studies, we show that taking out any one of the three stages of the curriculum degrades the learning performance.
研究动机与目标
- 解决在复杂、高自由度的地形上使用深度强化学习训练鲁棒双足行走策略的挑战。
- 通过利用简单手工设计的行走轨迹作为引导先验,减少对人类示范的依赖。
- 通过结构化、分阶段的课程逐步提升任务难度,提高样本效率和最终策略性能。
- 通过在训练过程中系统性地引入环境扰动,增强策略的鲁棒性。
- 通过消融实验验证课程中每一阶段的必要性和有效性。
提出的方法
- 第一阶段通过作用于机器人质心和各关节的引导力实现稳定,这些引导力源自一个基础的手工设计行走轨迹,以在日益困难的地形上促进探索。
- 第二阶段逐步将这些引导力的大小减小至零,使机器人平稳过渡到自主控制,确保从引导到策略驱动行为的顺利过渡。
- 第三阶段在机器人基座上施加逐渐增强幅度的随机扰动,以提高对外部干扰的鲁棒性。
- 课程分别应用于五类地形:平坦地形、缝隙、障碍物、楼梯和台阶,每类地形均使用独立的策略进行训练。
- 该方法使用深度强化学习,仅依赖单一标量密集奖励信号,通过课程进展克服稀疏奖励的挑战。
- 通过移除单个阶段进行消融研究,以评估其对最终性能的贡献。
实验结果
研究问题
- RQ1一个简单手工设计的行走轨迹能否作为有效先验,使DRL策略在无需人类示范的情况下成功穿越多样化复杂地形?
- RQ2多阶段课程学习方法是否能提升复杂地形上双足行走的样本效率和最终策略性能?
- RQ3各阶段(地形进展、力的减小、扰动暴露)对整体学习成功有何贡献?
- RQ4与始终施加恒定扰动或不施加扰动的训练方法相比,基于课程的训练方法在鲁棒性和泛化能力方面表现如何?
- RQ5训练后的策略在训练难度更高或更低的地形上,其泛化能力能达到何种程度?
主要发现
- 所提出的三阶段课程显著提升了学习性能,移除任一阶段均导致性能下降甚至训练失败。
- 在平坦地形上,课程方法在最大扰动下实现了总行进距离的87.1%,优于始终使用小扰动训练(45.9%)和始终使用大扰动训练(81.2%)。
- 在缝隙地形上,课程方法在最大扰动下实现了总行进距离的35.7%,显著优于小扰动训练(17.8%)和始终使用大扰动训练(22.7%)。
- 采用课程训练的策略表现出强大的泛化能力,在比训练难度高20%的地形上仍保持94.5%的性能,表明其具备鲁棒性和适应性。
- 在最困难地形上训练的策略在更简单地形上出现过拟合,例如缝隙策略在难度降低的地形上仅达到15.4%的性能,表明其对最终训练难度高度敏感。
- 该方法成功为五类不同地形(平坦、缝隙、障碍物、楼梯和台阶)分别训练出高性能、独立的策略,展示了方法的多功能性和可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。