[论文解读] Model Predictive Control via On-Policy Imitation Learning
本文提出 Forward-Switch,一种基于策略的模仿学习方法,通过利用模型预测控制(MPC)的结构并在学习到的时间窗口后切换至线性二次调节器(LQR),显著提升了在受限线性系统上学习显式MPC策略的数据效率与性能。该方法实现了稳定、满足约束的控制,且次优代价趋近于MPC性能,仿真结果验证了其在样本效率方面优于行为克隆与标准前向训练。
In this paper, we leverage the rapid advances in imitation learning, a topic of intense recent focus in the Reinforcement Learning (RL) literature, to develop new sample complexity results and performance guarantees for data-driven Model Predictive Control (MPC) for constrained linear systems. In its simplest form, imitation learning is an approach that tries to learn an expert policy by querying samples from an expert. Recent approaches to data-driven MPC have used the simplest form of imitation learning known as behavior cloning to learn controllers that mimic the performance of MPC by online sampling of the trajectories of the closed-loop MPC system. Behavior cloning, however, is a method that is known to be data inefficient and suffer from distribution shifts. As an alternative, we develop a variant of the forward training algorithm which is an on-policy imitation learning method proposed by Ross et al. (2010). Our algorithm uses the structure of constrained linear MPC, and our analysis uses the properties of the explicit MPC solution to theoretically bound the number of online MPC trajectories needed to achieve optimal performance. We validate our results through simulations and show that the forward training algorithm is indeed superior to behavior cloning when applied to MPC.
研究动机与目标
- 解决行为克隆在模仿MPC控制器时固有的数据效率低下与分布偏移问题。
- 为具有在线MPC反馈的受限线性系统,开发一种样本高效、交互式的模仿学习方法。
- 为所学控制器提供关于稳定性、约束满足性与代价次优性的理论保证。
- 通过实现基于策略的数据收集,减少误差累积,改进非交互式模仿学习方法。
- 在仿真中验证该方法相较于行为克隆与标准前向训练的优越性。
提出的方法
- 通过修改以处理长时域与受限线性系统,将基于策略梯度的前向训练算法——一种基于策略的模仿学习方法——适配于MPC应用。
- 引入一种切换机制,在数据估计的时间窗口后从MPC切换至LQR控制,利用时不变线性系统中MPC收敛至LQR的事实。
- 采用鲁棒MPC作为专家策略,以提升模仿过程的鲁棒性并降低对分布偏移的敏感性。
- 通过与系统在MPC控制器反馈下交互,收集在线轨迹,确保训练分布与部署分布一致。
- 理论分析利用高维统计与统计学习理论,界定了所需MPC轨迹数量,确保收敛至最优性能。
- 该算法估计一个时间窗口 $\hat{\tau}_{\infty}$,在此之后系统在LQR控制下进入正不变集,从而实现安全切换。
实验结果
研究问题
- RQ1与行为克隆相比,基于策略的模仿学习是否能减少学习MPC策略时的分布偏移与误差累积?
- RQ2通过模仿学习稳定线性系统并满足约束,理论上所需的样本复杂度是多少?
- RQ3如何将前向训练算法适配以处理具有状态与输入约束的长时域MPC问题?
- RQ4在数据估计的时间窗口后切换至LQR是否能提升模仿学习MPC的样本效率与性能?
- RQ5所学控制器能否以高概率实现接近MPC的代价次优性?其次优性的理论边界是什么?
主要发现
- 在d=5系统上,Forward-Switch仅使用180次MPC示范,即实现了约1.034的平均归一化代价至目标值,显著优于标准前向训练。
- 标准前向训练使用210次示范,平均归一化代价至目标值约为35,表明因分布偏移导致严重性能下降。
- 所提方法将代价次优性降低至最优性能的3.4%以内,展示了在有限数据下接近最优的控制性能。
- 即使在两者均使用相同12步时域的情况下,Forward-Switch仍优于其行为克隆对应方法,体现出更高的样本效率与鲁棒性。
- 理论分析提供了样本复杂度边界及对稳定性与约束满足性的保证,而这些在先前的模仿学习MPC方法中均未提供。
- 对于d=5系统,估计的时间窗口 $\hat{\tau}_{\infty} = 12$ 足够确保安全切换至LQR,验证了切换策略的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。