Skip to main content
QUICK REVIEW

[论文解读] A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning

Laura Smith, Ilya Kostrikov|arXiv (Cornell University)|Aug 16, 2022
Robotic Locomotion and Control被引用 25
一句话总结

本文展示了使用无模型深度强化学习进行四足动物行走的真实世界学习,在大约 20 分钟内在多种地形上实现行走,且未使用新算法。它强调任务设计与实现的慎重性高于新的算法进展。

ABSTRACT

Deep reinforcement learning is a promising approach to learning policies in uncontrolled environments that do not require domain knowledge. Unfortunately, due to sample inefficiency, deep RL applications have primarily focused on simulated environments. In this work, we demonstrate that the recent advancements in machine learning algorithms and libraries combined with a carefully tuned robot controller lead to learning quadruped locomotion in only 20 minutes in the real world. We evaluate our approach on several indoor and outdoor terrains which are known to be challenging for classical model-based controllers. We observe the robot to be able to learn walking gait consistently on all of these terrains. Finally, we evaluate our design decisions in a simulated environment.

研究动机与目标

  • 证明完全无模型的深度强化学习能够在真实世界中直接在不到 20 分钟内学习四足行走。
  • 在多样化的室内外地形上展示行走的鲁棒性,且不依赖新颖的算法组件。
  • 识别实现样本高效的真实世界运动学习所需的设计选择和系统因素。

提出的方法

  • 使用基于 SAC/DroQ 风格框架的离策略演员-评论家 RL,并结合正则化( dropout、层归一化)以实现较高的更新与数据比率。
  • 采用 20 Hz 的 12 joints 的 PD 位置目标作为低级动作空间。
  • 将状态定义为根部取向/速度、关节状态、足部接触以及前一动作;动作为 PD 目标。
  • 在目标速度区间内提供一个简单的基于速度的奖励,并投影到地面平面。
  • 在真实机器人(A1)上使用 JAX 进行同步训练,配合一个 Q 函数集与目标网络。
  • 比较各种正则化/归一化策略,以实现样本效率,而不是寻求新的算法组件。

实验结果

研究问题

  • RQ1完全无模型的深度强化学习能否在较短的实际耗时内直接在真实世界中学习四足行走?
  • RQ2设计选择(动作空间、奖励、正则化)如何影响真实世界运动学习中样本效率和训练稳定性?
  • RQ3在多种地形和环境中不进行仿真到现实的转移,真实世界的行走策略学习是否具有鲁棒性?
  • RQ4同步逐步更新与基于回合的更新对真实世界训练效率上的影响?

主要发现

  • 在严格设计下,使用标准的无模型 RL 可以在不到 20 minutes 内学习到真实世界行走(大约总共 20 minutes 的 wall-clock 时间)。
  • 在包括室内/室外在内的五种地形上训练可获得有效的步态,且不依赖新颖的算法组件。
  • 各种正则化/归一化策略(如层归一化、 dropout)能够实现更高的更新对数据比,从而提高样本效率。
  • 同步、逐步更新在具有 GPU 的笔记本电脑上进行实时训练是可行且有益的。
  • 对行动空间的约束和为各关节选择 PD 目标对于真实世界中的稳定学习至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。