Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning Controller for 3D Path-following and Collision Avoidance by Autonomous Underwater Vehicles

Simen Theie Havenstrøm, Adil Rasheed|arXiv (Cornell University)|Jun 17, 2020
Robotic Path Planning Algorithms参考文献 25被引用 9
一句话总结

本文提出一种基于近端策略优化(PPO)的深度强化学习(DRL)控制器,用于自主水下航行器(AUVs)的3D路径跟踪与避碰,利用传感输入和兼顾路径精度与避碰的奖励函数。该方法实现了人类水平的决策能力,在极端障碍物场景下碰撞率为99.25%,在海流干扰下路径跟踪误差小于1米。

ABSTRACT

Control theory provides engineers with a multitude of tools to design controllers that manipulate the closed-loop behavior and stability of dynamical systems. These methods rely heavily on insights about the mathematical model governing the physical system. However, in complex systems, such as autonomous underwater vehicles performing the dual objective of path-following and collision avoidance, decision making becomes non-trivial. We propose a solution using state-of-the-art Deep Reinforcement Learning (DRL) techniques, to develop autonomous agents capable of achieving this hybrid objective without having à priori knowledge about the goal or the environment. Our results demonstrate the viability of DRL in path-following and avoiding collisions toward achieving human-level decision making in autonomous vehicle systems within extreme obstacle configurations.

研究动机与目标

  • 解决欠驱动AUV中3D路径跟踪与避碰的挑战,传统控制方法在目标冲突时表现困难。
  • 开发一种基于DRL的控制器,无需环境或目标的先验知识,即可学习平衡路径精度与避碰。
  • 仅使用状态反馈和声纳输入,在复杂动态水下环境中实现自主决策。
  • 在不同障碍物配置下评估控制器的鲁棒性,包括极端情况如死胡同和堆叠障碍物。
  • 证明DRL在真实水动力干扰下实现AUV导航人类水平性能的可行性。

提出的方法

  • 使用先进的连续控制算法近端策略优化(PPO)训练DRL智能体,学习AUV执行器的控制策略。
  • 智能体观测AUV的状态(位置、速度、姿态)、控制误差、海流扰动以及前向声纳数据。
  • 采用带二次惩罚项的奖励函数,针对路径偏差、碰撞、过度控制努力和横摇进行惩罚,通过可调超参数λr平衡路径跟踪与避碰。
  • 使用独立的PI控制器维持期望巡航速度,而DRL智能体负责舵面和升降舵的控制以实现轨迹跟踪与避碰。
  • 通过课程学习方法,从简单路径逐步过渡到更复杂的障碍物配置进行训练,包括极端障碍物堆叠。
  • 在每个难度等级下通过100次实验的统计采样评估性能,测量成功率、碰撞率和平均跟踪误差。

实验结果

研究问题

  • RQ1DRL智能体是否能在缺乏环境先验知识的情况下,有效平衡自主水下航行器的3D路径跟踪与避碰?
  • RQ2奖励函数中的权衡参数λr如何影响智能体在路径精度与避碰之间的行为表现?
  • RQ3DRL智能体在极端障碍物配置(如死胡同或堆叠障碍物)下的泛化能力如何?
  • RQ4在持续海流干扰下,DRL控制器是否能保持高路径跟踪精度?
  • RQ5DRL智能体是否能在复杂动态水下环境中实现人类水平的决策能力?

主要发现

  • 即使在海流扰动下,DRL智能体的平均路径跟踪误差仍低于1米,证明了其出色的路径跟踪精度。
  • 通过λr = 0.5调优的控制器在复杂障碍物环境中表现出有效的避碰能力,对最优路径的偏离极小。
  • 专家级智能体(λr = 0.1)在400次测试样本中实现了99.25%的无碰撞率,碰撞仅出现在最高难度级别。
  • 在20米半球形障碍物构成的死胡同测试中,所有智能体均成功在允许半径内抵达目标,展示了强大的障碍物导航能力。
  • 智能体学会了保守而有效地使用侧向控制面,避免不必要的作动,最小化横摇,符合奖励函数的设计意图。
  • 结果证实,结合PPO的DRL可在复杂3D环境中实现AUV的人类水平决策能力,有效平衡相互竞争的目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。