[论文解读] Practical Reinforcement Learning For MPC: Learning from sparse objectives in under an hour on a real robot
本文提出了一种实用的强化学习方法,仅通过稀疏的二元奖励训练价值函数,以提升真实无人地面车辆(UGV)上的模型预测控制(MPC)。通过将深度价值函数学习与MPC结合,采用梯度正则化、经验回放和n步目标,该方法在车载CPU上仅用不到30分钟的真实世界训练即实现了专家水平的性能,优于基线MPC和密集奖励强化学习基线。
Model Predictive Control (MPC) is a powerful control technique that handles constraints, takes the system's dynamics into account, and optimizes for a given cost function. In practice, however, it often requires an expert to craft and tune this cost function and find trade-offs between different state penalties to satisfy simple high level objectives. In this paper, we use Reinforcement Learning and in particular value learning to approximate the value function given only high level objectives, which can be sparse and binary. Building upon previous works, we present improvements that allowed us to successfully deploy the method on a real world unmanned ground vehicle. Our experiments show that our method can learn the cost function from scratch and without human intervention, while reaching a performance level similar to that of an expert-tuned MPC. We perform a quantitative comparison of these methods with standard MPC approaches both in simulation and on the real robot.
研究动机与目标
- 实现仅使用高层级、稀疏目标的端到端、无需人工干预的MPC控制器训练。
- 通过基于值的强化学习克服MPC中复杂代价函数调优的挑战。
- 在计算资源极少的物理机器人上实现样本高效、实时的学习。
- 在仿真和真实硬件上对比基于学习的MPC与标准MPC及专家调优MPC的性能。
- 验证基于稀疏奖励的价值函数学习在真实部署中可优于密集奖励强化学习。
提出的方法
- 该方法采用演员-评论家框架,其中评论家为一个深度神经网络,用于估计价值函数$ V_{\theta}(\boldsymbol{s}) $,通过时序差分学习和均方误差损失进行训练。
- 对价值网络的雅可比矩阵应用梯度正则化,以在MPC优化过程中提高数值稳定性和收敛性。
- 采用基于系统对称性的数据增强的经验回放,提升样本效率并增强在对称状态间的泛化能力。
- 使用n步回报目标以平衡偏差与方差,加速训练收敛。
- 采用目标网络通过将Bootstrap目标与在线网络解耦来稳定训练。
- MPC演员使用学习到的价值函数作为终端代价,实现全局优化并提升轨迹规划性能。
实验结果
研究问题
- RQ1仅从稀疏的二元奖励中学习到的价值函数能否在真实机器人上实现与专家调优MPC相当的MPC性能?
- RQ2将价值函数学习与MPC结合是否能提升物理系统上的样本效率和收敛性?
- RQ3该方法是否可完全在车载设备上仅使用CPU资源进行训练,并在一小时内仍实现高性能?
- RQ4在真实世界部署中,从稀疏奖励学习与从密集奖励学习相比表现如何?
- RQ5梯度正则化和数据增强在真实世界MPC训练中对稳定性和性能的提升程度如何?
主要发现
- 该方法仅在车载CPU上进行30分钟的真实世界训练后,即实现了与专家调优MPC控制器相当的性能。
- 所学习的控制器在仿真和真实世界实验中均优于标准MPC基线和密集奖励强化学习基线。
- 梯度正则化在训练期间对MPC优化的稳定性至关重要,可防止发散并实现真实世界部署。
- 利用系统对称性进行数据增强,在无需额外数据采集的情况下提升了泛化能力和样本效率。
- n步回报目标相比TD(0)或蒙特卡洛目标,有助于实现更快的收敛。
- 该方法成功仅从稀疏的二元奖励中进行学习,展示了在长时域任务中对稀疏信用分配的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。