[论文解读] Efficient Learning of Control Policies for Robust Quadruped Bounding using Pretrained Neural Networks
本文提出了一种数据高效的强化学习框架,通过微调预训练的神经网络策略,实现对四足奔跑步态的鲁棒控制。通过借鉴基于模型的控制器的模仿学习,并结合一种考虑相位与接触状态的奖励函数进行优化,该方法实现了高效的深度强化学习训练,并可直接部署于真实世界的Jueying Mini机器人上,在复杂室内与室外不平整地形上实现了稳定的运动。
Bounding is one of the important gaits in quadrupedal locomotion for negotiating obstacles. The authors proposed an effective approach that can learn robust bounding gaits more efficiently despite its large variation in dynamic body movements. The authors first pretrained the neural network (NN) based on data from a robot operated by conventional model based controllers, and then further optimised the pretrained NN via deep reinforcement learning (DRL). In particular, the authors designed a reward function considering contact points and phases to enforce the gait symmetry and periodicity, which improved the bounding performance. The NN based feedback controller was learned in the simulation and directly deployed on the real quadruped robot Jueying Mini successfully. A variety of environments are presented both indoors and outdoors with the authors approach. The authors approach shows efficient computing and good locomotion results by the Jueying Mini quadrupedal robot bounding over uneven terrain.
研究动机与目标
- 提升在训练四足奔跑步态鲁棒控制策略时的样本效率。
- 解决在不平整地形上四足运动中高维动态运动的挑战。
- 实现从仿真环境到真实物理机器人直接部署所学策略。
- 通过强化学习中的奖励函数设计,保持步态的对称性与周期性。
- 相比端到端强化学习训练,减少训练时间与计算成本。
提出的方法
- 使用四足机器人上常规基于模型的控制器生成的示范数据,预训练神经网络策略。
- 在仿真环境中,使用深度强化学习(DRL)对预训练策略进行微调。
- 设计一种奖励函数,显式编码接触点时序与步态相位信息,以强化对称性与周期性。
- 采用反馈控制架构,神经网络根据状态观测(包括机体姿态与接触状态)输出关节力矩。
- 在包含多样化地形变化的仿真环境中训练策略,以提升鲁棒性。
- 将最终策略直接部署于真实世界的Jueying Mini机器人上,无需进一步调优。
实验结果
研究问题
- RQ1在基于模型的控制器示范数据上进行预训练,是否能显著降低四足奔跑步态深度强化学习策略训练的样本复杂度?
- RQ2一种考虑相位与接触状态的奖励函数,在促进对称与周期性步态模式方面有多高效?
- RQ3在仿真环境中训练的策略,能在多大程度上泛化到真实世界不平整地形?
- RQ4与端到端强化学习相比,预训练+微调强化学习在训练效率与鲁棒性方面存在多大性能差距?
- RQ5最终策略是否可直接部署于硬件上,而无需使用领域随机化或仿真到现实的迁移技巧?
主要发现
- 预训练并微调后的策略在Jueying Mini机器人上,于多种室内与室外地形上均实现了稳定的奔跑步态。
- 与端到端DRL训练相比,该方法显著减少了训练时间与样本复杂度。
- 结合接触与相位监督的奖励函数成功强化了步态的周期性与对称性,提升了运动质量。
- 策略在无需额外仿真到现实适应步骤的情况下,成功部署于真实机器人上。
- 系统对地形不规则性表现出鲁棒性,包括斜坡与不平整地面。
- 该方法在样本效率与真实世界性能之间实现了良好平衡,其训练效率优于标准DRL方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。