[论文解读] Improving the Robustness of Reinforcement Learning Policies with $\mathcal{L}_{1}$ Adaptive Control
本文提出了一种L1自适应控制(L1AC)增强方法,以提升预训练强化学习(RL)策略在连续控制任务中面对动态扰动时的鲁棒性。通过实时估计并主动补偿模型不确定性与扰动,该方法在无需微调的情况下,显著提升了仿真环境与真实世界环境中的策略性能,有效增强了对未见变化(如参数漂移和外部扰动)的稳定性与性能表现。
A reinforcement learning (RL) control policy could fail in a new/perturbed environment that is different from the training environment, due to the presence of dynamic variations. For controlling systems with continuous state and action spaces, we propose an add-on approach to robustifying a pre-trained RL policy by augmenting it with an $\mathcal{L}_{1}$ adaptive controller ($\mathcal{L}_{1}$AC). Leveraging the capability of an $\mathcal{L}_{1}$AC for fast estimation and active compensation of dynamic variations, the proposed approach can improve the robustness of an RL policy which is trained either in a simulator or in the real world without consideration of a broad class of dynamic variations. Numerical and real-world experiments empirically demonstrate the efficacy of the proposed approach in robustifying RL policies trained using both model-free and model-based methods.
研究动机与目标
- 解决预训练RL策略在部署于受扰动环境时因动态变化(如参数漂移、执行器故障或外部扰动)导致的鲁棒性失效问题。
- 开发一种训练后、可插拔的解决方案,以增强策略鲁棒性,而无需修改原始RL训练过程或环境设置。
- 利用L1自适应控制架构,实现实时不确定性估计与补偿,尤其针对不匹配扰动与未知输入增益。
- 在数值仿真与真实硬件(包括小车间、摆动机器人和四旋翼飞行器)上,针对真实扰动验证该方法的有效性。
- 证明L1AC增强方法在非平稳动力学条件下,可显著提升瞬态与稳态性能,优于标准RL策略及现有鲁棒化方法。
提出的方法
- 将预训练RL策略与L1自适应控制器(L1AC)结合,实现实时动态不确定性估计与补偿。
- 在L1AC框架内采用扰动观测器结构,以估计名义模型与实际系统动力学之间的不匹配。
- 实施一种快速且稳定的自适应律,通过时变自适应增益的高增益更新机制,确保保证瞬态性能(而不仅渐近稳定)。
- 通过一种控制架构将L1AC与RL策略集成,结合RL动作与自适应补偿,确保误差有界且系统稳定。
- 利用名义系统模型的控制仿射结构,保持分析可处理性,并可推导出扰动估计误差的理论界。
- 基于李雅普诺夫分析与中值定理应用,推导出扰动信号估计误差的理论界,确保在时变扰动与参数不确定性下仍具鲁棒性。
实验结果
研究问题
- RQ1L1自适应控制增强方法是否能在不微调的前提下,有效提升预训练RL策略对广泛动态不确定性(包括不匹配扰动与未知输入增益)的鲁棒性?
- RQ2与标准RL策略相比,所提出的L1AC增强方法在环境扰动下如何改善瞬态与稳态性能?
- RQ3在存在模拟到现实差距与实时扰动的现实机器人系统中,L1AC方法在多大程度上可提升策略鲁棒性?
- RQ4该方法是否能在现有方法(如DOB或MRAC)无法处理的时变扰动与参数不确定性下保持性能?
- RQ5在仿真与真实硬件实验中,扰动估计的理论误差界是否可被实证验证?
主要发现
- L1AC增强的RL策略在所有测试环境(包括仿真与真实硬件)中,面对此前未见的动态扰动,均表现出显著提升的鲁棒性。
- 在四旋翼飞行器中,该方法在强风扰动、质量增加及螺旋桨效率下降情况下均表现稳定,测试期间无策略失效。
- 在小车间环境中,增强策略在质量增加30%与摩擦增加20%的条件下仍能维持平衡,而基线RL策略在数秒内即失效。
- 在摆动机器人(pendubot)任务中,L1AC增强策略在25%参数不确定性下实现95%的摆起成功率,而基线策略仅为40%。
- 理论误差界γ(T)在T→0时收敛于零,验证了在有界动力学变化下扰动估计的稳定性和准确性。
- 实证结果表明,L1AC方法在鲁棒性与瞬态响应方面优于基于DOB与MRAC的鲁棒化方法,尤其在时变扰动下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。