[论文解读] Model-Reference Reinforcement Learning for Collision-Free Tracking Control of Autonomous Surface Vehicles
本文提出了一种用于自主水面航行器(ASVs)的模型参考强化学习(RL)框架,通过将基线跟踪控制器与自适应RL相结合,在模型不确定条件下实现无碰撞轨迹跟踪。该方法利用名义系统模型和基于李雅普诺夫的稳定性保证,确保了鲁棒性、更高的样本效率以及闭环稳定性,且无需掌握完整的系统动力学知识,在稳定性与收敛性方面优于传统深度强化学习方法。
This paper presents a novel model-reference reinforcement learning algorithm for the intelligent tracking control of uncertain autonomous surface vehicles with collision avoidance. The proposed control algorithm combines a conventional control method with reinforcement learning to enhance control accuracy and intelligence. In the proposed control design, a nominal system is considered for the design of a baseline tracking controller using a conventional control approach. The nominal system also defines the desired behaviour of uncertain autonomous surface vehicles in an obstacle-free environment. Thanks to reinforcement learning, the overall tracking controller is capable of compensating for model uncertainties and achieving collision avoidance at the same time in environments with obstacles. In comparison to traditional deep reinforcement learning methods, our proposed learning-based control can provide stability guarantees and better sample efficiency. We demonstrate the performance of the new algorithm using an example of autonomous surface vehicles.
研究动机与目标
- 解决在未知水动力学与干扰条件下,自主水面航行器(ASVs)的精确、无碰撞轨迹跟踪挑战。
- 克服传统路径规划与基于模型的控制方法存在的时延、保守性或高建模需求等局限。
- 开发一种基于学习的控制框架,确保闭环稳定性与鲁棒性,同时补偿模型不确定性。
- 与标准深度强化学习方法相比,提升ASV控制中的样本效率与稳定性。
提出的方法
- 定义一个名义系统模型,利用传统控制方法设计基线跟踪控制器,以表征无障碍物环境下的期望行为。
- 整体控制器将基线控制器与强化学习模块相结合,后者学习补偿模型不确定性与干扰。
- 采用基于李雅普诺夫的稳定性分析,保证跟踪误差的统一最终有界性,确保在不确定性下的闭环稳定性。
- 强化学习智能体采用双延迟深度确定性策略梯度(TD3)算法,结合经验回放与目标网络,以实现稳定训练。
- 评论网络评估状态-动作价值,而演员网络输出控制动作,两者均通过时间差分学习更新,折扣因子γ = 0.998。
- 该方法引入一种奖励塑形函数,对跟踪误差与靠近障碍物的距离进行惩罚,实现碰撞避免与轨迹跟踪的同步优化。
实验结果
研究问题
- RQ1模型参考强化学习框架是否能在系统建模需求最小化的情况下,实现对不确定ASVs的稳定、无碰撞跟踪?
- RQ2与标准深度强化学习相比,该方法在ASV控制中如何提升样本效率与稳定性?
- RQ3在保持闭环稳定性的同时,RL模块在多大程度上能够补偿未建模的动力学与环境干扰?
- RQ4将名义控制器与RL相结合,是否能实现比独立RL或经典控制方法更优的跟踪精度与鲁棒性?
主要发现
- 所提出的模型参考强化学习方法实现了跟踪误差的统一最终有界性,理论稳定性通过李雅普诺夫分析得到保证。
- 该方法在样本效率与收敛速度方面优于标准深度强化学习基线方法。
- 控制器在动态环境中成功实现障碍物规避,同时在跟踪复杂轨迹时保持安全距离。
- 仿真结果表明,跟踪误差始终处于有界区域内,且可通过控制增益调节最终有界值。
- 在不确定性条件下,该方法在瞬态响应方面(如减少超调与缩短稳定时间)优于传统鲁棒与自适应控制方法。
- 使用名义系统模型可实现更优的初始化与收敛性能,降低在高维控制空间中不稳定学习的风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。