[论文解读] Data-Driven Recovery of Optimal Feedback Laws through Optimality Conditions and Sparse Polynomial Regression
本文提出一种数据驱动方法,通过利用庞特里亚金最大值原理作为表示公式来生成状态-值对和梯度,进而通过LASSO回归拟合稀疏多项式模型,以计算高维最优反馈律。该方法减少了训练样本需求,并在包含梯度数据时产生更低复杂度的反馈律。
A data-driven approach for the computation of high-dimensional optimal feedback laws arising in deterministic nonlinear control is proposed. The approach exploits the control-theoretical link between Hamilton-Jacobi-Bellman PDEs characterizing the value function of the optimal control problems, and first-order optimality conditions via Pontryagin's Maximum Principle. The latter is used as a representation formula to recover the value function and its gradient at arbitrary points in the space-time domain through the solution of a two-point boundary value problem. After generating a dataset consisting of different state-value pairs, a hyperbolic cross polynomial model for the value function is fitted using a LASSO regression. An extended set of low and high-dimensional numerical tests in nonlinear optimal control reveal that enriching the dataset with gradient information reduces the number of training samples, and that the sparse polynomial regression consistently yields a feedback law of lower complexity.
研究动机与目标
- 开发一种可扩展的数据驱动方法,用于计算高维非线性控制问题中的最优反馈律。
- 利用哈密顿-雅可比-贝尔曼偏微分方程与庞特里亚金最大值原理之间的联系,实现高效的价值函数恢复。
- 通过使用LASSO正则化的稀疏多项式回归,降低反馈律的复杂度。
- 研究在训练数据集中包含梯度信息对样本效率和模型复杂度的影响。
提出的方法
- 利用庞特里亚金最大值原理,通过两点边值问题的求解,在任意状态-时间点计算价值函数及其梯度。
- 通过数值求解两点边值问题,生成状态-值对及其对应梯度值的数据集。
- 构建双曲交叉多项式基,以在高维空间中表示价值函数。
- 应用LASSO回归,将稀疏多项式模型拟合到数据集中,以促进低复杂度解的生成。
- 通过引入梯度信息丰富训练数据集,以提升样本效率和模型精度。
- 在一系列低维与高维非线性最优控制问题上验证该方法。
实验结果
研究问题
- RQ1如何利用庞特里亚金最大值原理生成高维控制问题中反馈律近似的训练数据?
- RQ2在训练数据集中包含梯度信息对所需样本数量有何影响?
- RQ3LASSO正则化的稀疏多项式回归能否有效捕捉非线性系统中最优反馈律的结构?
- RQ4在训练过程中包含梯度数据如何影响最终反馈律的稀疏性与复杂度?
- RQ5该方法在多大程度上可扩展至高维最优控制问题?
主要发现
- 在训练数据集中包含梯度信息可显著减少准确近似反馈律所需的训练样本数量。
- 稀疏多项式回归模型始终产生比密集模型更低复杂度的反馈律。
- 该方法在低维与高维非线性最优控制问题中均能实现准确的反馈律恢复。
- 使用双曲交叉多项式基可有效逼近高维价值函数。
- 当在训练过程中引入梯度数据时,该方法表现出更高的样本效率与模型稀疏性。
- 通过该方法推导出的反馈律计算效率高,适用于实时实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。