Skip to main content
QUICK REVIEW

[论文解读] Model-free optimal control of discrete-time systems with additive and multiplicative noises

Jing Lai, Junlin Xiong|arXiv (Cornell University)|Aug 20, 2020
Adaptive Dynamic Programming Control参考文献 28被引用 6
一句话总结

该论文提出了一种针对具有加性噪声和乘性噪声的离散时间系统最优控制的无模型强化学习算法,采用批量最小二乘法和数值平均方法估计Q函数核矩阵,无需系统矩阵信息。该方法收敛至最优控制策略,并在数值实验中优于其他策略迭代算法,展现出对未知随机系统的鲁棒性和实用性。

ABSTRACT

This paper investigates the optimal control problem for a class of discrete-time stochastic systems subject to additive and multiplicative noises. A stochastic Lyapunov equation and a stochastic algebra Riccati equation are established for the existence of the optimal admissible control policy. A model-free reinforcement learning algorithm is proposed to learn the optimal admissible control policy using the data of the system states and inputs without requiring any knowledge of the system matrices. It is proven that the learning algorithm converges to the optimal admissible control policy. The implementation of the model-free algorithm is based on batch least squares and numerical average. The proposed algorithm is illustrated through a numerical example, which shows our algorithm outperforms other policy iteration algorithms.

研究动机与目标

  • 解决在系统矩阵完全未知条件下,具有加性与乘性噪声的离散时间随机系统的最优控制问题。
  • 开发一种无模型强化学习算法,仅使用状态和输入数据学习最优控制策略,无需系统动力学的先验知识。
  • 在一般随机系统条件下,为所提出的学习算法建立收敛性保证。
  • 消除测量噪声或部分系统矩阵知识等限制性假设,提升实际适用性。
  • 通过数值实例展示该算法在收敛速度和准确性方面优于现有策略迭代与无模型强化学习算法。

提出的方法

  • 采用折扣无限时域代价函数来制定最优控制问题,以确保在加性噪声存在下仍保持有界性。
  • 推导出随机代数 Riccati 方程(SARE)和随机 Lyapunov 方程(SLE),以在已知系统矩阵条件下刻画最优控制策略。
  • 提出一种离线策略迭代(PI)算法,通过矩阵更新迭代求解SARE,并证明其收敛性。
  • 开发一种在线无模型强化学习算法,利用批量最小二乘法(BLS)和数值平均方法估计Q函数核矩阵,以近似数学期望。
  • 通过直接使用数据驱动估计替代对可测量噪声的假设,提升算法的鲁棒性与适用性。
  • 采用经验平均估计期望,并利用BLS估计核矩阵,避免使用神经网络或模型近似。

实验结果

研究问题

  • RQ1能否为具有加性与乘性噪声的离散时间随机系统设计一种无模型强化学习算法,且无需系统矩阵知识?
  • RQ2在一般噪声条件下,如何仅通过观测到的状态和输入轨迹学习最优控制策略?
  • RQ3在何种条件下可保证所提出的无模型强化学习算法收敛至真实最优控制策略?
  • RQ4与现有策略迭代和无模型强化学习方法相比,该算法在收敛速度和准确性方面的表现如何?
  • RQ5该算法能否在不假设噪声可测量或不依赖模型神经网络的情况下实现?

主要发现

  • 所提出的无模型强化学习算法可收敛至最优控制策略,其收敛性已通过在已知系统矩阵下与离线PI算法的等价性得到证明。
  • 控制增益估计值为 $\hat{L} = [-0.9369\ -1.5772]$,与最优值 $L^* = [-0.9319\ -1.5784]$ 非常接近。
  • 估计的最优代价为 $\hat{V}(x_0) = 62.1118$,与真实最优代价 $V^*(x_0) = 62.0422$ 相比,相对误差小于0.11%。
  • 在数值比较中,所提算法收敛速度更快,且相对代价误差低于[2]中的PI算法和[29]中的PI算法,性能与MFLQv3相当。
  • 在控制增益精度和收敛速度方面,该算法优于其他基于PI的方法,仅因数值平均引入轻微波动。
  • 该方法比以往工作更具实用性,因其无需可测量噪声或模型神经网络,且更易于实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。