[论文解读] Reinforcement Learning Ship Autopilot: Sample efficient and Model Predictive Control-based Approach
本文提出了一种样本高效的概率模型预测控制(SPMPC)方法,这是一种基于模型的强化学习方法,结合高斯过程动力学建模与迭代MPC,实现了对真实尺寸船只的样本高效、鲁棒的自动驾驶控制。该系统在极少人类示范的情况下,能够自主学习在真实海洋环境中导航,仅通过600次环境交互便在4分钟内实现稳定的目标跟踪。
In this research we focus on developing a reinforcement learning system for a challenging task: autonomous control of a real-sized boat, with difficulties arising from large uncertainties in the challenging ocean environment and the extremely high cost of exploring and sampling with a real boat. To this end, we explore a novel Gaussian processes (GP) based reinforcement learning approach that combines sample-efficient model-based reinforcement learning and model predictive control (MPC). Our approach, sample-efficient probabilistic model predictive control (SPMPC), iteratively learns a Gaussian process dynamics model and uses it to efficiently update control signals within the MPC closed control loop. A system using SPMPC is built to efficiently learn an autopilot task. After investigating its performance in a simulation modeled upon real boat driving data, the proposed system successfully learns to drive a real-sized boat equipped with a single engine and sensors measuring GPS, speed, direction, and wind in an autopilot task without human demonstration.
研究动机与目标
- 为解决真实世界船只自主性中高昂的样本成本以及环境不确定性问题,特别是由于风向、洋流和传感器噪声的不可预测性。
- 开发一种无需人类示范的强化学习系统,以适用于真实尺寸的无人水面航行器。
- 结合基于模型的强化学习、高斯过程与MPC,以提升在动态海洋环境中的样本效率与实时鲁棒性。
- 在基于真实船只数据校准的高保真仿真环境以及真实船只于开放海洋条件下的实验中验证系统性能。
- 证明单台配备传感器的船只可通过仅基于强化学习的策略学习,自主抵达并维持目标位置。
提出的方法
- SPMPC使用稀疏高斯过程(GP)对船只的动力学进行建模,在贝叶斯框架下捕捉不确定性。
- 通过强化学习滚动过程中收集的数据,迭代地改进GP模型,从而随时间提升预测精度。
- 采用有限时域的模型预测控制(MPC)框架来计算控制动作,实现实时反馈与扰动抑制。
- 在GP模型中实施偏差补偿,以校正状态估计与控制输入中的系统性误差。
- 基于到目标的欧几里得距离设计代价函数,优化在H=5步的预测时域内进行。
- 采用混合数据采集策略:50%随机动作与50%策略驱动的探索,以平衡探索与利用。
实验结果
研究问题
- RQ1在真实船只自主性中,由于真实世界数据采集成本高昂,基于模型的强化学习方法结合GP动力学建模是否能实现样本效率?
- RQ2将GP不确定性与MPC反馈相结合,能否显著提升对风、洋流等不可预测海洋扰动的鲁棒性?
- RQ3系统是否能在无任何人类示范的情况下,仅通过强化学习在真实海洋环境中学习到稳定的自动驾驶策略?
- RQ4在使用不同数量的伪输入时,稀疏GP在计算效率与模型精度之间存在何种权衡?
- RQ5在GP模型中引入偏差补偿在真实世界条件下在多大程度上提升了控制性能?
主要发现
- SPMPC系统成功在约3.5分钟内,仅通过600次环境交互,将真实尺寸船只导航至目标位置[100,100]。
- 当使用500个伪输入时,GP模型的平均滚动误差为64.46米;而使用50个伪输入时,误差上升至121.03米,但推理时间显著降低至1.55秒。
- 系统在真实海洋扰动下表现出鲁棒性,包括风速2 m/s(方向135°)与洋流0.0–0.2 m/s(方向45°),即使在环境条件变化下仍能保持目标附近。
- 在GP模型中引入偏差补偿显著提升了控制性能,实现了无需先前人类示范的稳定跟踪。
- 在强化学习过程中,系统在20步内(约2.5分钟)即实现收敛,表明其具有极强的样本效率。
- 真实世界实验验证了SPMPC框架可在有限硬件条件下实现实时、计算可行的控制,成功在开放海洋环境中实现稳定的自动驾驶运行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。