[论文解读] Critic-Only Integral Reinforcement Learning Driven by Variable Gain Gradient Descent for Optimal Tracking Control
该论文提出了一种仅含评论家的积分强化学习(IRL)框架,结合可变增益梯度下降法,用于具有执行器约束的连续时间非线性系统的最优跟踪控制。通过嵌入基于HJB误差和李雅普诺夫导数的稳定项与自适应学习率,该方法消除了对初始稳定控制器和双逼近器网络的需求,实现了更紧致的残差集的统一最终有界性,已在6自由度无人机模型上得到验证。
Integral reinforcement learning (IRL) was proposed in literature to obviate the requirement of drift dynamics in adaptive dynamic programming framework. Most of the online IRL schemes in literature require two sets of neural network (NNs), known as actor-critic NN and an initial stabilizing controller. Recently, for RL-based robust tracking this requirement of initial stabilizing controller and dual-approximator structure could be obviated by using a modified gradient descent-based update law containing a stabilizing term with critic-only structure. To the best of the authors' knowledge, there has been no study on leveraging such stabilizing term in IRL algorithm framework to solve optimal trajectory tracking problems for continuous time nonlinear systems with actuator constraints. To this end a novel update law leveraging the stabilizing term along with variable gain gradient descent in IRL framework is presented in this paper. With these modifications, the IRL tracking controller can be implemented using only critic NN, while no initial stabilizing controller is required. Another salient feature of the presented update law is its variable learning rate, which scales the pace of learning based on instantaneous Hamilton-Jacobi-Bellman error and rate of variation of Lyapunov function along the system trajectories. The augmented system states and NN weight errors are shown to possess uniform ultimate boundedness (UUB) stability under the presented update law and achieve a tighter residual set. This update law is validated on a full 6-DoF nonlinear model of UAV for attitude control.
研究动机与目标
- 解决现有在线IRL和ADP框架在最优跟踪控制中需要初始稳定控制器的挑战。
- 消除基于IRL的最优跟踪中的双逼近器(评论家-评论家)结构,降低计算负载。
- 开发一种学习率自适应机制,提升IRL基最优控制的收敛性并减小残差集大小。
- 仅使用一个评论家神经网络,在执行器约束和部分系统知识下确保稳定性和鲁棒性。
- 在具有真实控制约束和动力学的完整6自由度非线性无人机模型上验证所提方法。
提出的方法
- 设计了一种新颖的参数更新律,采用可变增益梯度下降法,其中学习率根据系统轨迹上瞬时的汉密尔顿-雅可比-贝尔曼(HJB)误差及其变化率动态调整。
- 更新律在仅含评论家的结构中引入了稳定项,使得无需初始稳定控制器即可实现策略迭代。
- 该方法运行于在线、策略内IRL框架中,避免了探索阶段,具备实时适用性。
- 单个评论家神经网络用于近似值函数,替代传统的评论家-评论家双神经网络架构,降低计算复杂度。
- 在所提出的更新律下,增强系统状态和评论家权重误差被证明是统一最终有界的(UUB)。
- 通过加入抖动噪声维持持续激励,确保参数收敛并避免回归矩阵的秩不足。
实验结果
研究问题
- RQ1仅含评论家的IRL框架能否在无需初始稳定控制器的情况下,实现具有执行器约束的连续时间非线性系统的最优跟踪控制?
- RQ2基于HJB误差和李雅普诺夫导数的可变增益梯度下降法,相较于固定学习率方法,如何提升收敛性并减小残差集大小?
- RQ3在所提出的更新律下,增强系统的稳定性行为如何?能否保证统一最终有界性?
- RQ4与IRL中的双逼近器评论家-评论家框架相比,仅含评论家的结构在多大程度上降低了计算负载?
- RQ5在动力学部分已知的真实非线性系统(如6自由度无人机)中,所提方法的性能如何?
主要发现
- 所提出的仅含评论家的IRL框架结合可变增益梯度下降法,实现了增强系统状态和评论家权重误差的统一最终有界性(UUB)。
- 更新律中的稳定项成功消除了对初始稳定控制器的需求,相较于现有IRL和ADP方案具有显著优势。
- 基于HJB误差和李雅普诺夫导数的可变学习率,相比固定学习率方案,实现了更紧致的残差集。
- 仿真结果表明,评论家神经网络权重在有限时间内收敛至接近理想权重的值。
- 升降舵、副翼和方向舵的控制输入均保持在±90度的执行器饱和限制内,证实了其在实时实现中的可行性。
- 值函数近似误差趋近于零,表明所生成的控制策略近似最优,仿真中代价接近零,已得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。