[论文解读] Improving Input-Output Linearizing Controllers for Bipedal Robots via Reinforcement Learning
该论文通过强化学习(RL)增强输入-输出线性化控制器,以应对双足机器人的模型不确定性与输入饱和问题。通过引入一个学习得到的补偿项,并将转矩约束融入强化学习训练过程,该方法在显著的模型失配和饱和条件下,实现了RABBIT机器人行走的稳定控制,实现了极小转矩增加下的局部指数稳定性,并在训练分布内的未见步态上展现出良好的泛化能力。
The main drawbacks of input-output linearizing controllers are the need for precise dynamics models and not being able to account for input constraints. Model uncertainty is common in almost every robotic application and input saturation is present in every real world system. In this paper, we address both challenges for the specific case of bipedal robot control by the use of reinforcement learning techniques. Taking the structure of a standard input-output linearizing controller, we use an additive learned term that compensates for model uncertainty. Moreover, by adding constraints to the learning problem we manage to boost the performance of the final controller when input limits are present. We demonstrate the effectiveness of the designed framework for different levels of uncertainty on the five-link planar walking robot RABBIT.
研究动机与目标
- 解决输入-输出线性化控制器在双足机器人中的局限性,特别是对模型不确定性的敏感性以及无法处理输入饱和的问题。
- 开发一种数据驱动框架,以提升在真实动力学和执行器约束下的鲁棒性与性能。
- 通过将强化学习与混合零动态(HZD)框架结合,实现对欠驱动、混合系统的稳定、长时程行走控制。
- 利用庞加莱分析确保在转矩饱和条件下,所得控制器仍具有局部指数稳定性。
- 在训练轨迹分布范围内,实现对未见过的周期性步态的泛化能力。
提出的方法
- 将Westenbroek等人(2019)的强化学习框架扩展至使用HZD方法的混合型、欠驱动双足系统。
- 采用基于DDPG的强化学习智能体,学习一个附加校正项,以补偿输入-输出线性化控制器中的模型不确定性。
- 将显式的转矩饱和约束融入强化学习目标函数,以提升在执行器极限下的性能表现。
- 设计一种有限时间收敛的反馈控制器,用于训练期间稳定系统,确保在欠驱动条件下的鲁棒性。
- 基于参考轨迹的贝塞尔系数定义输出函数,实现针对特定轨迹的线性化控制。
- 通过计算关于周期性步态的线性化庞加莱映射的特征值,应用庞加莱分析验证局部指数稳定性。
实验结果
研究问题
- RQ1强化学习能否有效用于校正双足机器人输入-输出线性化控制器中的模型不确定性?
- RQ2在强化学习训练中引入输入饱和约束,如何提升控制器在真实系统中的性能表现?
- RQ3在原始控制器失效的高模型-实物失配条件下,RL增强控制器是否仍能实现行走稳定?
- RQ4训练后的控制器在多大程度上能泛化至未训练的周期性步态?
- RQ5通过庞加莱分析验证,RL增强控制器在转矩饱和条件下是否仍保持局部指数稳定性?
主要发现
- 在150%的模型失配(缩放系数=3)和转矩饱和条件下,RL增强的输入-输出线性化控制器成功稳定了RABBIT机器人行走,而原始控制器在几步后即失效。
- 在高不确定性与转矩饱和条件下,线性化庞加莱映射的主导特征值为0.83,证实了局部指数稳定性。
- 与原始IO控制器相比,该控制器维持了相近的转矩幅值,避免了执行器的过度努力。
- 该控制器对与训练轨迹相似的未训练轨迹(如轨迹2)表现出良好的泛化能力,实现了稳定的长时程行走。
- 在显著不同的轨迹上(如轨迹3),性能下降,表明其泛化能力受限于状态分布的相似性。
- 当原始IO控制器在行走步长的大部分时间内仍能保持功能时,训练过程才得以收敛,凸显了在高不确定性条件下的一项关键限制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。