[论文解读] Depth Control of Model-Free AUVs via Reinforcement Learning
本文提出一种基于深度确定性策略梯度(DDPG)的无模型强化学习框架,结合优先经验回放,用于自主水下航行器(AUV)的深度控制,无需精确的动力学模型。该方法通过神经网络从采样轨迹中学习状态反馈控制器,在部分可观测条件下实现与基于模型的控制器(如LQI和NMPC)相当的性能,即使在真实海底跟踪任务中亦然。
In this paper, we consider depth control problems of an autonomous underwater vehicle (AUV) for tracking the desired depth trajectories. Due to the unknown dynamical model of the AUV, the problems cannot be solved by most of model-based controllers. To this purpose, we formulate the depth control problems of the AUV as continuous-state, continuous-action Markov decision processes (MDPs) under unknown transition probabilities. Based on deterministic policy gradient (DPG) and neural network approximation, we propose a model-free reinforcement learning (RL) algorithm that learns a state-feedback controller from sampled trajectories of the AUV. To improve the performance of the RL algorithm, we further propose a batch-learning scheme through replaying previous prioritized trajectories. We illustrate with simulations that our model-free method is even comparable to the model-based controllers as LQI and NMPC. Moreover, we validate the effectiveness of the proposed RL algorithm on a seafloor data set sampled from the South China Sea.
研究动机与目标
- 解决在无法获取精确动力学模型或其获取不切实际时AUV深度控制的挑战。
- 将三种深度控制问题——恒定深度控制、曲线轨迹跟踪和海底跟踪——表述为连续状态、连续动作的马尔可夫决策过程(MDP)。
- 开发一种无模型强化学习算法,直接从AUV轨迹数据中学习状态反馈控制器,而无需依赖系统动力学。
- 通过使用过去轨迹的优先经验回放机制,实现批量学习,提升数据效率和学习收敛性。
- 在模拟AUV动力学和南海真实海底数据上验证该方法,证明其在部分可观测条件下的鲁棒性。
提出的方法
- 将深度控制问题建模为具有自定义状态和单步成本函数的连续状态、连续动作MDP,以反映跟踪误差和控制努力。
- 采用基于深度确定性策略梯度(DDPG)的算法,使用两个神经网络:策略网络用于动作选择,Q值网络用于动作价值估计。
- 使用带有目标网络的时序差分学习以稳定训练,并通过贝尔曼方程更新Q值网络。
- 应用优先经验回放机制,基于TD误差重用过去经验,提升样本效率和收敛速度。
- 设计一种状态表示,整合近期相对深度测量值(窗口大小)以补偿曲线或海底跟踪中不可观测的深度轨迹趋势。
- 通过在线策略滚动和离策略回放端到端训练策略,交替更新策略网络和Q值网络。
实验结果
研究问题
- RQ1在缺乏精确动力学模型的情况下,无模型强化学习方法能否实现与LQI和NMPC等基于模型控制器相当的深度控制性能?
- RQ2在部分可观测的深度跟踪场景中,状态表示的选择——特别是近期深度历史的引入——如何影响强化学习策略的性能?
- RQ3在曲线或海底跟踪任务中,为提升策略性能,应采用多大的历史相对深度测量窗口大小?
- RQ4优先经验回放如何提升基于DDPG的学习算法在AUV深度控制中的数据效率和收敛性?
- RQ5所提出的强化学习框架能否在部分可观测条件下有效跟踪来自南海的复杂真实海底剖面?
主要发现
- 所提出的NNDPG算法在仿真中实现了与LQI和NMPC等基于模型控制器相当的跟踪性能,即使在无法访问真实AUV动力学的情况下亦然。
- 使用近期相对深度测量窗口(窗口大小=3)显著提升了曲线深度跟踪的性能,通过提供隐含的趋势信息,相比仅使用当前深度,可降低跟踪误差。
- 对10次实验的长期成本进行箱线图分析显示,窗口大小3的均值和方差最低,表明在信息增益与过时数据噪声之间达到最佳平衡。
- 优先经验回放提升了学习收敛性和数据效率,使在AUV有限在线数据条件下也能实现有效训练。
- 该算法成功跟踪了来自南海的真实海底剖面,证明其在仅依赖相对深度历史输入的情况下,对复杂、快速变化地形具有鲁棒性和适应性。
- 本研究证实状态设计至关重要:适用于恒定深度控制的状态在曲线轨迹中变为部分可观测,因此必须通过历史深度数据进行状态增强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。