Skip to main content
QUICK REVIEW

[论文解读] Stein Variational Model Predictive Control

Alexander Lambert, Adam Fishman|arXiv (Cornell University)|Nov 15, 2020
Advanced Control Systems Optimization参考文献 37被引用 18
一句话总结

本文提出斯坦因变分模型预测控制(SV-MPC),一种新颖的MPC框架,通过使用斯坦因变分梯度下降(SVGD)将控制解表示为控制参数上的非参数后验分布。通过将MPC建模为贝叶斯推断问题,SV-MPC有效处理了复杂、多模态且非凸的最优控制问题,在导航和操作等具有挑战性的机器人任务中表现出色,相较于MPPI和CEM,成功率更高且成本更低。

ABSTRACT

Decision making under uncertainty is critical to real-world, autonomous systems. Model Predictive Control (MPC) methods have demonstrated favorable performance in practice, but remain limited when dealing with complex probability distributions. In this paper, we propose a generalization of MPC that represents a multitude of solutions as posterior distributions. By casting MPC as a Bayesian inference problem, we employ variational methods for posterior computation, naturally encoding the complexity and multi-modality of the decision making problem. We present a Stein variational gradient descent method to estimate the posterior directly over control parameters, given a cost function and observed state trajectories. We show that this framework leads to successful planning in challenging, non-convex optimal control problems.

研究动机与目标

  • 为解决传统MPC在处理控制输入上复杂、非高斯、多模态分布方面的局限性。
  • 实现在存在障碍物、多个目标或非凸约束的非凸最优控制问题中的有效规划。
  • 开发一种可扩展的在线MPC方法,能够实时适应非平稳后验分布的机器人决策。
  • 利用变分推断与SVGD,高效地对控制参数的后验分布进行非参数近似。
  • 提供一个统一框架,可泛化至轨迹优化,并与现有MPC和SOC方法无缝集成。

提出的方法

  • 将MPC建模为贝叶斯推断问题,其中后验分布定义在控制参数上,而非联合状态-动作分布上。
  • 通过相对熵最小化近似真实后验,实现对控制序列的变分推断。
  • 采用斯坦因变分梯度下降(SVGD)迭代更新一组表示控制输入后验分布的粒子。
  • 通过下三角矩阵变换定义控制序列上的先验,其结构类似于高斯过程。
  • 集成包含障碍物规避(通过双模高斯混合地图实现)和目标到达惩罚的代价函数。
  • 以在线、滚动时域方式应用该方法,每时间步进行热启动和迭代优化。

实验结果

研究问题

  • RQ1像SVGD这样的非参数变分推断方法是否能有效表示复杂、非凸最优控制问题中的多模态控制策略?
  • RQ2在不确定性下,SV-MPC与MPPI和CEM等基于采样的MPC方法相比,在成功率和成本最小化方面表现如何?
  • RQ3所提出的框架能否处理真实机器人控制中常见的非平稳、快速变化的后验分布?
  • RQ4粒子数量和优化迭代次数对SV-MPC控制器性能和收敛性有何影响?
  • RQ5控制序列先验的选择如何影响轨迹平滑性和规划性能?

主要发现

  • 在4×4障碍物网格的平面导航任务中,SV-MPC使用32个粒子实现了96%的成功率,平均成本为20.7×10³,优于MPPI和CEM(成功率分别为64%,成本更高)。
  • 使用12个粒子时,SV-MPC仍保持96%的成功率,成本仅略微上升至21.8×10³,表明对粒子数量减少具有鲁棒性。
  • 6个粒子的SV-MPC版本成功率下降至84%,表明性能对粒子数量敏感,但在高粒子数下仍优于MPPI和CEM。
  • 使用32个粒子的SV-MPC平均成本(20.7×10³)低于MPPI(26.5×10³)和CEM(25.4×10³),表明在存在障碍物时具有更好的成本最小化能力。
  • 该方法成功处理了Half-cheetah和操作任务中的非凸性,表明其可扩展至高维控制问题。
  • 使用平滑、马尔可夫先验对控制序列的建模,带来了更平滑的状态轨迹,与以往工作中使用GP先验的效果类似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。