Skip to main content
QUICK REVIEW

[论文解读] Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle

Qilei Zhang, Jinying Lin|arXiv (Cornell University)|Jan 10, 2020
Underwater Vehicles and Communication Systems参考文献 31被引用 6
一句话总结

本文提出了一种深度交互式强化学习(Dirl)框架,通过结合人类形状奖励与环境奖励,加速自主水下航行器(AUVs)的路径跟踪学习。通过在训练过程中整合人类反馈,并利用环境奖励实现持续适应,该方法相较于仅依赖环境奖励训练的DQN智能体,实现了更快的收敛速度和更优的鲁棒性,在模拟环境中性能达到或超过纯人类奖励方法。

ABSTRACT

Autonomous underwater vehicle (AUV) plays an increasingly important role in ocean exploration. Existing AUVs are usually not fully autonomous and generally limited to pre-planning or pre-programming tasks. Reinforcement learning (RL) and deep reinforcement learning have been introduced into the AUV design and research to improve its autonomy. However, these methods are still difficult to apply directly to the actual AUV system because of the sparse rewards and low learning efficiency. In this paper, we proposed a deep interactive reinforcement learning method for path following of AUV by combining the advantages of deep reinforcement learning and interactive RL. In addition, since the human trainer cannot provide human rewards for AUV when it is running in the ocean and AUV needs to adapt to a changing environment, we further propose a deep reinforcement learning method that learns from both human rewards and environmental rewards at the same time. We test our methods in two path following tasks---straight line and sinusoids curve following of AUV by simulating in the Gazebo platform. Our experimental results show that with our proposed deep interactive RL method, AUV can converge faster than a DQN learner from only environmental reward. Moreover, AUV learning with our deep RL from both human and environmental rewards can also achieve a similar or even better performance than that with the deep interactive RL method and can adapt to the actual environment by further learning from environmental rewards.

研究动机与目标

  • 解决深度强化学习(DRL)在AUV路径跟踪中稀疏奖励与学习缓慢的挑战。
  • 克服传统DRL方法仅依赖环境奖励而导致样本效率差的局限性。
  • 引入交互式强化学习(IRL),通过形状化奖励融入人类专业知识,加速策略学习。
  • 开发一种混合学习框架,结合人类与环境奖励,确保在真实海洋环境中长期适应能力。
  • 在Gazebo模拟平台中,通过两条路径跟踪任务——直线与正弦曲线跟踪——验证所提方法的有效性。

提出的方法

  • 提出一种深度交互式强化学习(Dirl)方法,将人类提供的奖励与环境提供的奖励相结合,以塑造学习信号。
  • 使用深度Q网络(DQN)作为价值函数近似器,将原始状态观测(如位置、速度、航向)映射为动作Q值。
  • 设计一种混合奖励函数,结合人类指定的形状化奖励(以加速学习)与环境定义的稀疏奖励(以实现长期适应)。
  • 实施两阶段学习过程:首先通过人类反馈进行初始训练以加速收敛,随后通过环境奖励持续学习以增强鲁棒性。
  • 在基于Gazebo的模拟环境中训练并评估智能体,完成两条路径跟踪任务:直线与正弦轨迹跟踪。
  • 采用课程学习原则,随着训练推进逐步减少人类反馈,同时增加对环境奖励的依赖。

实验结果

研究问题

  • RQ1与仅使用环境奖励的标准化DQN相比,采用人类形状奖励的交互式强化学习是否能显著降低样本复杂度并加速AUV路径跟踪任务的收敛?
  • RQ2将人类奖励与环境奖励相结合,对AUV策略在动态且不确定的海洋环境中的最终性能与鲁棒性有何影响?
  • RQ3在人类反馈不再可用的情况下,使用人类与环境奖励联合训练的DRL智能体能否保持高性能并适应未见的环境变化?
  • RQ4仅使用环境奖励、仅使用人类奖励以及两者结合训练的智能体,在相对学习速度与最终跟踪精度方面有何差异?
  • RQ5混合奖励策略在复杂路径跟踪任务(如正弦轨迹跟踪)中,对泛化能力与稳定性的提升程度如何?

主要发现

  • 仅从人类奖励学习的DQNH智能体在第60集时达到的跟踪误差水平与仅从环境奖励学习的DQNE智能体相当,但仅用20集即达此性能,表明收敛速度提升约3倍。
  • 从人类与环境奖励联合学习的DQNHE智能体在减少跟踪误差方面优于DQNH与DQNE智能体,于第25集即达到近似最优性能。
  • DQNHE智能体的累积环境奖励在约20集时达到峰值,而DQNE智能体则需约80集才达类似水平,表明混合奖励策略能实现更快的策略优化。
  • 在正弦曲线跟踪任务中,DQNHE智能体仅用25集即达到DQNE智能体在第100集的性能水平,展现出更优的样本效率。
  • 即使在人类反馈停止后,DQNHE智能体仍保持高性能与强适应能力,证明其在真实世界部署场景中的鲁棒性。
  • 所提出的深度交互式强化学习方法在收敛速度与学习稳定性方面优于仅使用环境奖励的标准化DQN,验证了人类在环路奖励塑造在AUV控制中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。