Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Constrained Reinforcement Learning Algorithms for Legged Locomotion

Joonho Lee, Lukas Schroth|arXiv (Cornell University)|Sep 27, 2023
Robotic Locomotion and Control被引用 6
一句话总结

本文采用约束马尔可夫决策过程(CMDP)框架,评估了用于足式运动的约束强化学习(CRL)算法,以强制执行关节速度和转矩限制等物理约束。通过将约束与奖励解耦,该方法减少了约束违反情况,并提升了仿真到现实世界的迁移性能,其中N-P3O在真实机器人实验中表现出更优的性能和稳定性。

ABSTRACT

Shifting from traditional control strategies to Deep Reinforcement Learning (RL) for legged robots poses inherent challenges, especially when addressing real-world physical constraints during training. While high-fidelity simulations provide significant benefits, they often bypass these essential physical limitations. In this paper, we experiment with the Constrained Markov Decision Process (CMDP) framework instead of the conventional unconstrained RL for robotic applications. We perform a comparative study of different constrained policy optimization algorithms to identify suitable methods for practical implementation. Our robot experiments demonstrate the critical role of incorporating physical constraints, yielding successful sim-to-real transfers, and reducing operational errors on physical systems. The CMDP formulation streamlines the training process by separately handling constraints from rewards. Our findings underscore the potential of constrained RL for the effective development and deployment of learned controllers in robotics.

研究动机与目标

  • 填补现有强化学习研究在足式机器人策略训练过程中忽视物理约束的空白。
  • 通过在学习过程中直接整合硬性物理约束(如转矩、速度限制)来改善仿真到现实世界的迁移性能。
  • 评估并比较一阶约束策略优化算法在维持约束合规性的同时实现高运动性能的能力。
  • 证明将约束与奖励分离可减少对复杂奖励塑造的依赖,并增强策略鲁棒性。
  • 开发并验证一个适用于实际部署的实用CRL流程,应用于轮足机器人。

提出的方法

  • 将足式运动建模为约束马尔可夫决策过程(CMDP),通过成本函数和阈值显式建模物理约束。
  • 应用三种一阶CRL算法——N-P3O、PPO-Lagrangian和CRPO——每种算法采用不同的优化策略来强制执行约束。
  • 在成本评论网络中引入softplus输出层,以确保成本值估计非负,从而提升训练稳定性。
  • 实施约束惩罚系数(κ)的动态调度,以延迟约束强制执行,促进训练初期的探索。
  • 采用熵正则化并使用衰减系数,以提升策略平滑性和泛化能力。
  • 应用领域随机化和本体感觉状态观测(速度、关节状态、重力)以增强策略鲁棒性。

实验结果

研究问题

  • RQ1不同约束策略优化算法在足式运动中的约束违反情况和最终性能方面如何比较?
  • RQ2在训练期间强制执行物理约束是否能减少仿真中对大量奖励塑造的依赖?
  • RQ3CMDP框架是否能提升仿真到现实世界的迁移性能,并增强真实世界足式机器人运行的可靠性?
  • RQ4不同成本函数设计(如指示函数、平方ReLU)对约束违反频率和偏差有何影响?
  • RQ5通过softplus实现的非负成本评论器训练如何影响学习稳定性和约束满足情况?

主要发现

  • N-P3O算法在所有评估方法中实现了最低的约束违反次数(每集0.05次)和最高的性能(平均奖励72.83)。
  • 使用指示函数作为成本函数时,约束违反次数最少,其次是关节数量成本函数。
  • 采用softplus激活的成本评论器相比标准线性评论器,降低了成本回报估计的方差,提升了训练稳定性。
  • CMDP框架在真实世界部署中成功减少了约束违反,证明了在轮足机器人上有效的仿真到现实世界迁移。
  • 约束惩罚系数(κ)的动态调度防止了过早收敛,增强了探索能力,从而提升了最终策略质量。
  • 该方法减少了对物理极限奖励塑造的依赖,简化了策略设计并提升了泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。