Skip to main content
QUICK REVIEW

[论文解读] Model-Reference Reinforcement Learning Control of Autonomous Surface Vehicles with Uncertainties

Qingrui Zhang, Wei Pan|arXiv (Cornell University)|Mar 30, 2020
Reinforcement Learning in Robotics参考文献 32被引用 10
一句话总结

该论文提出了一种基于模型参考的强化学习控制框架,将传统基线控制律与深度强化学习相结合,以稳定不确定的自主水面航行器(ASVs)并提升轨迹跟踪性能。通过结合传统控制的稳定性保障与深度强化学习的自适应补偿能力,该方法实现了更快的收敛速度、更高的样本效率以及闭环稳定性——仿真结果表明,其轨迹跟踪性能和稳定性优于纯强化学习或仅使用基线控制的方法。

ABSTRACT

This paper presents a novel model-reference reinforcement learning control method for uncertain autonomous surface vehicles. The proposed control combines a conventional control method with deep reinforcement learning. With the conventional control, we can ensure the learning-based control law provides closed-loop stability for the overall system, and potentially increase the sample efficiency of the deep reinforcement learning. With the reinforcement learning, we can directly learn a control law to compensate for modeling uncertainties. In the proposed control, a nominal system is employed for the design of a baseline control law using a conventional control approach. The nominal system also defines the desired performance for uncertain autonomous vehicles to follow. In comparison with traditional deep reinforcement learning methods, our proposed learning-based control can provide stability guarantees and better sample efficiency. We demonstrate the performance of the new algorithm via extensive simulation results.

研究动机与目标

  • 解决受非线性水动力学和未知环境干扰影响的自主水面航行器(ASVs)的轨迹跟踪挑战。
  • 克服纯深度强化学习的局限性,如缺乏闭环稳定性及样本效率低下。
  • 将传统控制与深度强化学习相结合,以确保系统稳定性,同时实现对模型不确定性的自适应补偿。
  • 通过使用名义系统作为学习参考,提升样本效率和跟踪精度。
  • 提供一种无需持续激励或对不确定性边界有先验知识的稳定、数据驱动的控制解决方案。

提出的方法

  • 定义一个名义系统,利用传统控制方法设计基线控制律,确保整个系统的闭环稳定性。
  • 基于ASV的线性化模型,采用带有增益矩阵G和H的状态反馈控制器推导基线控制律。
  • 采用深度强化学习学习一种校正控制律,以补偿名义模型未能捕捉的模型不确定性与干扰。
  • 学习过程通过历史数据离线进行,使用随机梯度下降,避免部署阶段对持续激励的需求。
  • 整体控制输入为基线控制与深度强化学习生成的校正项之和,形成混合控制架构。
  • 采用基于李雅普诺夫的稳定性分析,确保在存在不确定性的情况下,组合控制律仍能保持系统稳定性。

实验结果

研究问题

  • RQ1结合传统控制与深度强化学习的混合控制框架,能否确保不确定ASVs的闭环稳定性?
  • RQ2引入基线控制律在ASV控制中对深度强化学习的样本效率有何影响?
  • RQ3在存在建模不确定性的情况下,深度强化学习相较于仅使用基线控制,能在多大程度上提升轨迹跟踪性能?
  • RQ4当参考轨迹发生变化时,该方法是否能在不重新训练的情况下保持稳定性与性能?
  • RQ5该方法能否在不依赖对不确定性与干扰频率或结构先验知识的情况下实现有效补偿?

主要发现

  • 与纯深度强化学习相比,所提方法在训练过程中实现了更快的收敛速度和更高的长期回报,表明样本效率得到提升。
  • 与仅使用基线控制相比,引入基线控制使平均绝对距离误差降低了约50%,显著提升了跟踪精度。
  • 在首次评估中,所提方法在200秒内实现了稳定的轨迹跟踪,而纯强化学习无法维持稳定性。
  • 在第二次评估中,参考轨迹发生变化,所提方法保持了闭环稳定性,并在跟踪精度上优于基线控制和纯强化学习方法。
  • 学习曲线显示,与仅使用强化学习的基线相比,所提算法更快收敛至更高的回报值,证实了样本效率的提升。
  • 该方法成功补偿了未匹配的不确定性与干扰,且无需事先了解其频率或结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。