[论文解读] Reinforcement Learning-Based Automatic Berthing System
本文提出一种基于强化学习的自动靠泊系统,采用近端策略优化(PPO)算法,无需依赖大量预先收集的靠泊数据。通过在模拟海洋环境中与智能体进行试错交互训练,该系统学习到最优的舵角和每秒转数(RPS)控制策略,在各种初始条件下(包括超出训练分布的外推场景)均表现出鲁棒的靠泊性能。
Previous studies on automatic berthing systems based on artificial neural network (ANN) showed great berthing performance by training the ANN with ship berthing data as training data. However, because the ANN requires a large amount of training data to yield robust performance, the ANN-based automatic berthing system is somewhat limited due to the difficulty in obtaining the berthing data. In this study, to overcome this difficulty, the automatic berthing system based on one of the reinforcement learning (RL) algorithms, proximal policy optimization (PPO), is proposed because the RL algorithms can learn an optimal control policy through trial-and-error by interacting with a given environment and does not require any pre-obtained training data, where the control policy in the proposed PPO-based automatic berthing system controls revolutions per second (RPS) and rudder angle of a ship. Finally, it is shown that the proposed PPO-based automatic berthing system eliminates the need for obtaining the training dataset and shows great potential for the actual berthing application.
研究动机与目标
- 为克服现有基于人工神经网络(ANN)的自动靠泊系统中数据稀缺的局限性,这些系统需要大量真实靠泊数据进行训练。
- 利用强化学习(RL)开发一种数据高效的自动靠泊解决方案,通过与模拟环境交互学习最优控制策略。
- 证明基于PPO的智能体能够泛化到训练分布之外的初始条件,确保在实际应用中的鲁棒性。
- 验证精心设计的奖励函数可引导智能体实现期望的靠泊行为,而无需事先了解船舶操纵动力学。
提出的方法
- 系统采用近端策略优化(PPO)这一深度强化学习算法,训练一个神经网络策略,将状态映射为动作。
- 状态表示包括归一化的船舶位置(η, ξ)、航向角(ψ)、到目标点的距离(d),以及纵航、横移和偏航方向的速度(u, v, r)。
- 动作定义为舵角(δ)和每秒转数(n),并受物理限制:1 ≤ n ≤ 1,-35° ≤ δ ≤ 35°,且 |dδ/dt| ≤ 3°/s。
- 设计了一个密集且形状优化的奖励函数,以鼓励收敛至靠泊目标,惩罚距离、角度偏差和控制努力。
- 智能体在模拟海洋环境中通过马尔可夫决策过程(MDP)框架进行训练,状态空间和动作空间均为连续。
- 训练持续约20小时,使用PPO算法每隔N步更新策略,结果通过轨迹仿真进行评估。
实验结果
研究问题
- RQ1基于PPO的强化学习智能体是否能在不依赖预先存在的靠泊数据集的情况下学习到鲁棒的靠泊策略?
- RQ2训练后的PPO智能体在训练范围之外的初始船舶位置上泛化能力如何?
- RQ3奖励函数在多大程度上能够塑造靠泊行为,实现在不了解船舶动力学前提下的安全高效靠泊?
- RQ4PPO-based系统是否在各种初始条件下均实现了稳定且一致的靠泊性能?
主要发现
- 基于PPO的自动靠泊系统通过与环境交互成功学习到最优控制策略,完全消除了对预先收集靠泊数据的需求。
- 系统在多种初始位置下表现出鲁棒性能,包括超出训练分布的初始条件,表明其具备强大的泛化能力。
- 奖励函数随时间的历史曲线在约20小时训练后收敛,表明PPO算法已达到稳定且最优的策略。
- 仿真中的靠泊轨迹显示出对目标点的精确且平滑收敛,即使在极端初始构型下也仅有极小的超调或振荡。
- 系统在多个测试案例中均实现了稳定的靠泊性能,所有测试场景(包括外推的初始状态)均成功完成靠泊。
- 开源的仿真代码和预训练模型已公开发布于GitHub,支持可复现性与进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。