[论文解读] Lyapunov Design for Robust and Efficient Robotic Reinforcement Learning
本文提出了一种基于李雅普诺夫的代价整形方法,将控制李雅普诺夫函数(CLFs)整合到强化学习(RL)目标中,以实现在数据高效、鲁棒的机器人稳定控制器学习。通过在标准代价函数中添加一个由CLF驱动的项,该方法确保即使策略次优,系统也能保持稳定,从而使RL算法能以少几个数量级的数据收敛到稳定控制器——在小车间和A1四足机器人上分别仅需数秒和数分钟的真实世界微调数据即完成验证。
Recent advances in the reinforcement learning (RL) literature have enabled roboticists to automatically train complex policies in simulated environments. However, due to the poor sample complexity of these methods, solving RL problems using real-world data remains a challenging problem. This paper introduces a novel cost-shaping method which aims to reduce the number of samples needed to learn a stabilizing controller. The method adds a term involving a Control Lyapunov Function (CLF) -- an `energy-like' function from the model-based control literature -- to typical cost formulations. Theoretical results demonstrate the new costs lead to stabilizing controllers when smaller discount factors are used, which is well-known to reduce sample complexity. Moreover, the addition of the CLF term `robustifies' the search for a stabilizing controller by ensuring that even highly sub-optimal polices will stabilize the system. We demonstrate our approach with two hardware examples where we learn stabilizing controllers for a cartpole and an A1 quadruped with only seconds and a few minutes of fine-tuning data, respectively. Furthermore, simulation benchmark studies show that obtaining stabilizing policies by optimizing our proposed costs requires orders of magnitude less data compared to standard cost designs.
研究动机与目标
- 为解决强化学习在真实世界机器人控制中样本效率差的问题,特别是针对复杂系统的稳定控制。
- 通过将系统结构嵌入学习目标,减少学习稳定控制器所需的真实世界数据样本数量。
- 通过CLF监督确保即使次优策略也能稳定系统,从而提升强化学习策略搜索的鲁棒性。
- 实现利用少量真实世界数据高效微调仿真训练得到的控制器。
- 通过学习或近似CLF,将基于CLF的控制设计方法扩展至具有不确定性的真实世界系统。
提出的方法
- 引入一种修改后的代价函数,添加基于控制李雅普诺夫函数(CLF)的项,激励策略随时间减少CLF值。
- 使用从简化或学习的动力学模型中导出的近似CLF来指导强化学习优化,即使真实CLF未知亦可。
- 采用软 actor-critic(SAC)算法并重塑奖励:$ r_k = -[W(F(x_k,u_k)) - W(x_k)] - \|x_k\|_2^2 - 0.1\|u_k\|_2^2 $,其中 $ W $ 为近似CLF。
- 将预训练仿真强化学习策略的值函数用作真实世界微调的近似CLF。
- 在强化学习中使用较小的折扣因子($ \gamma $)以加速学习,因理论分析表明,CLF项可使小 $ \gamma $ 对稳定有效。
- 对折扣因子进行超参数搜索,以确定能产生稳定策略的最小 $ \gamma $,确保数据效率。
实验结果
研究问题
- RQ1基于CLF的代价整形技术是否能显著减少学习稳定控制器所需的真实世界数据样本?
- RQ2在强化学习目标中引入CLF项是否能提升策略搜索的鲁棒性,使得即使高度次优的策略也能稳定系统?
- RQ3仿真强化学习策略的值函数能否作为真实硬件微调中可行的近似CLF?
- RQ4近似CLF的质量如何影响强化学习算法的数据效率和收敛速度?
- RQ5当与CLF监督结合时,小折扣因子是否能有效用于稳定,与标准强化学习实践相反?
主要发现
- 所提方法仅使用10秒真实世界数据即在Quanser小车间上学习到稳定控制器,性能与需120万步仿真数据的基线方法相当。
- 对于Unitree A1四足机器人,仅用5分钟真实世界数据即学习到稳定控制器,使用基于简化线性化模型的手动设计CLF。
- 在倒立摆实验中,CLF增强的代价函数将实现稳定所需的训练迭代次数从389次减少至198次(当输入约束紧时,$|u| \leq 4$),样本减少48%。
- 在输入约束较宽松时($|u| \leq 20$),该方法在5次迭代内即实现稳定,而基线需92次,样本需求减少94.6%。
- 导致稳定策略的最小折扣因子同时也是学习速度最快的,证实当存在CLF监督时,小 $ \gamma $ 是可行的。
- 即使近似CLF并非真正的全局CLF,该方法仍能确保系统稳定,表明对模型不准确具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。