[论文解读] Online Approximate Optimal Path-Following for a Kinematic Unicycle
本文提出了一种基于近似动态规划(ADP)与基于并发学习的自适应律的在线近似最优路径跟踪控制器,用于运动学单摆车。通过重新定义虚拟目标在路径上的进展以确保状态域的紧致性,并构建排除路径进展的改进型代价函数,该方法实现了无限时域最优控制策略的稳定在线逼近,保证了车辆到路径以及近似策略到最优策略的统一最终有界(UUB)收敛。
Online approximation of an infinite horizon optimal path-following strategy for a kinematic unicycle is considered. The solution to the optimal control problem is approximated using an approximate dynamic programming technique that uses concurrent-learning-based adaptive update laws to estimate the unknown value function. The developed controller overcomes challenges with the approximation of the infinite horizon value function using an auxiliary function that describes the motion of a virtual target on the desired path. The developed controller guarantees uniformly ultimately bounded (UUB) convergence of the vehicle to a desired path while maintaining a desired speed profile and UUB convergence of the approximate policy to the optimal policy. Simulation results are included to demonstrate the controller's performance.
研究动机与目标
- 开发一种无需持续激励的在线、实时最优路径跟踪控制器,用于运动学单摆车。
- 解决由于路径参数无界及恒定控制努力导致的无限时域路径跟踪控制问题的病态性。
- 在紧致域上使用神经网络稳定地在线逼近最优值函数与策略。
- 确保车辆以期望速度剖面稳定地收敛至期望路径,且收敛为统一最终有界(UUB)。
- 基于李雅普诺夫分析,为状态与策略逼近误差提供理论稳定性保证。
提出的方法
- 引入一个虚拟目标,其沿期望路径的运动由依赖于状态的常微分方程(ODE)控制,重新定义以确保相关状态保持在紧致域内。
- 将单摆车与虚拟目标之间的运动学误差动力学建模为一个自治系统,从而能够分析无限时域最优控制问题。
- 定义一种改进的控制输入,即设计控制与维持路径保持所需的名义控制之间的差值,从而将路径进展与代价函数解耦。
- 重新定义代价函数以排除虚拟目标的位置,确保代价有限,从而实现适定的最优控制问题。
- 采用近似动态规划(ADP)框架,利用神经网络逼近值函数与策略,并使用基于并发学习的梯度下降法实现在线自适应。
- 基于李雅普诺夫的稳定性分析证明了车辆状态到路径的UUB收敛,以及近似策略到最优策略的UUB收敛。
实验结果
研究问题
- RQ1能否在不依赖持续激励的条件下,为运动学单摆车开发一种在线逼近无限时域最优路径跟踪控制器?
- RQ2如何将值函数逼近中无界的路径参数转化为紧致域覆盖,以确保神经网络逼近的稳定性?
- RQ3何种控制结构可在恒定控制努力维持路径跟踪的情况下,实现有限代价与稳定路径跟踪?
- RQ4如何利用具有保证收敛特性的自适应学习实现实时最优策略逼近?
- RQ5能够为车辆状态与近似策略向最优解收敛提供何种理论保证?
主要发现
- 所提出的控制器确保了车辆状态以统一最终有界(UUB)方式收敛至期望路径,同时保持期望速度剖面。
- 近似策略经李雅普诺夫稳定性分析证明,其以UUB方式收敛至最优策略。
- 仿真结果表明,基于ADP的控制器生成的状态与控制轨迹,与离线GPOPS最优求解器所得解高度吻合。
- 神经网络权重估计收敛至稳态值,表明学习与策略逼近过程稳定。
- 控制器性能对值函数逼近中基函数的选择敏感,线性基函数在路径附近可实现良好的局部逼近。
- 该方法成功避免了自适应学习律中对持续激励的需求,实现了最优控制器的实时在线逼近。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。