[论文解读] Online Constrained Model-based Reinforcement Learning
该论文提出高斯过程-滚动时域控制(GP-RHC),一种数据高效、在线的基于模型强化学习方法,结合稀疏谱高斯过程进行增量动力学学习,以及滚动时域控制实现实时约束规划。该方法在连续机器人环境中实现快速、安全且自适应的学习,将圈速减少3.86%,并通过在线模型更新改善约束处理。
Applying reinforcement learning to robotic systems poses a number of challenging problems. A key requirement is the ability to handle continuous state and action spaces while remaining within a limited time and resource budget. Additionally, for safe operation, the system must make robust decisions under hard constraints. To address these challenges, we propose a model based approach that combines Gaussian Process regression and Receding Horizon Control. Using sparse spectrum Gaussian Processes, we extend previous work by updating the dynamics model incrementally from a stream of sensory data. This results in an agent that can learn and plan in real-time under non-linear constraints. We test our approach on a cart pole swing-up environment and demonstrate the benefits of online learning on an autonomous racing task. The environment's dynamics are learned from limited training data and can be reused in new task instances without retraining.
研究动机与目标
- 解决在连续状态和动作空间下机器人强化学习中的数据效率与实时规划挑战。
- 在硬性非线性约束(如赛道边界和避障)下实现安全运行。
- 支持从流式传感数据中在线更新模型,提升学习速度与鲁棒性。
- 允许在无需微调的情况下复用已学习的动力学模型于新任务,增强可迁移性。
- 在高速、安全关键的机器人任务(如自动驾驶竞速)中展示适用性。
提出的方法
- 使用稀疏谱高斯过程(SSGPs)从流式传感数据中学习并增量更新动力学模型。
- 采用滚动时域控制(RHC)结合内点求解器(FORCES)在约束下实现实时优化。
- 通过在目标函数中惩罚松弛变量来软化硬性约束,避免优化过程中的不可行性。
- 将学习到的动力学模型与RHC集成,实现在连续、约束环境中的在线规划与控制。
- 采用有限时域优化框架,每一步控制时间均基于最新状态估计与更新后的模型重新规划。
- 使用来自简单椭圆赛道的70组数据集训练初始动力学模型,该模型可泛化至复杂新赛道而无需重新训练。
实验结果
研究问题
- RQ1使用稀疏谱高斯过程进行在线学习是否能提升机器人基于模型强化学习中的数据效率与学习速度?
- RQ2结合软约束优化的滚动时域控制是否能实现实时机器人控制中复杂非线性约束的有效处理?
- RQ3在线模型更新是否能实现更快收敛并减少训练过程中的约束违反?
- RQ4在简单赛道上训练的动力学模型在无需重新训练的情况下,能在多大程度上复用于更复杂任务?
- RQ5在线模型自适应如何影响高速自动驾驶竞速任务中的性能表现?
主要发现
- 与无更新相比,使用在线模型更新时,GP-RHC将圈速减少3.86%(从2.745秒降至2.639秒)。
- 仅基于70个数据点在简单椭圆赛道上学习的模型,成功泛化至具有急转弯的复杂竞速赛道。
- 该方法实现了实时规划,每控制步最大仅需30次SQP迭代。
- 在线更新显著减少了学习过程中的约束违反,提升了安全性与一致性。
- 同一已学习的动力学模型可在不同任务(如竞速与避障)中复用,无需重新训练。
- 将赛道扩展至311米后,圈速提升4.56秒,相当于平均速度提高16.4 km/h,且在线更新下性能更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。