[论文解读] Learning to Walk in the Real World with Minimal Human Effort
本文提出一种用于腿式行走的自主现实世界RL系统,使用多任务学习和安全约束的SAC,在多种地形上以最少的人为干预训练步行动作策略,实现对Minitaur的高效现实世界学习并减少跌倒。
Reliable and stable locomotion has been one of the most fundamental challenges for legged robots. Deep reinforcement learning (deep RL) has emerged as a promising method for developing such control policies autonomously. In this paper, we develop a system for learning legged locomotion policies with deep RL in the real world with minimal human effort. The key difficulties for on-robot learning systems are automatic data collection and safety. We overcome these two challenges by developing a multi-task learning procedure and a safety-constrained RL framework. We tested our system on the task of learning to walk on three different terrains: flat ground, a soft mattress, and a doormat with crevices. Our system can automatically and efficiently learn locomotion skills on a Minitaur robot with little human intervention. The supplemental video can be found at: \url{https://youtu.be/cwyiq6dCgOc}.
研究动机与目标
- 减少用于现实世界腿式机器人学习的人力投入,通过自动化数据收集、重置和训练中的安全性。
- 在单次训练中实现多种行走技能(前进、后退、转弯)的学习。
- 在多样地形(平地、软垫、带缝隙的门垫)的鲁棒学习能力的展示。
- 证明安全约束的 RL 能在现实世界数据采集中减少跌倒和训练中断。
提出的方法
- 采用多任务RL框架,包含一个任务调度器,选择行走方向以将机器人保持在训练工作空间内。
- 为每个任务定义奖励,编码相对自episode起点的期望运动方向,使用三维任务向量 w^i。
- 为每个任务训练独立的SAC策略, 不共享 actor/critics,以避免跨任务干扰。
- 将安全约束引入为一个约束的MDP,使用拉格朗日乘子在训练期间对躯干俯仰/滚转进行约束。
- 使用对偶梯度下降来联合更新策略和拉格朗日乘子。
- 在工作空间边界附近使用提前终止,并结合安全感知回报计算,以防止过多的重置。
实验结果
研究问题
- RQ1自主现实世界RL能否在多种地形上实现对腿式运动的学习,且人机干预最小?
- RQ2在真实世界环境中同时训练多种行走策略是否可行?
- RQ3与标准方法相比,安全约束RL框架是否能减少跌倒次数和训练中断?
主要发现
- 该系统在平地、软垫以及带缝隙的门垫上学习行走,且人类干预极少(在三次平地试验中有两次实现零手动重置)。
- 可以在单次训练中学习四个行走策略(前进、后退、向左转、向右转),使测试时拥有完整的定向行走控制器。
- 在平地上,训练两个策略(前进和后退)大约需要1.5小时(每个策略约60k步)。
- 在挑战性表面上,前进/后退行走在5.5小时内学习完成(软垫,约200k步)和4.5小时(门垫,约150k步)。
- 安全约束的SAC相比不带安全约束的SAC显著减少跌倒(大约40次跌倒 vs. 基线中的>100次),从而减少训练中断。
- 多任务学习显著降低工作区之外的失败率,大约仅为基线的5-10%,在不同工作区大小上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。