Skip to main content
QUICK REVIEW

[论文解读] Continuous Control with Deep Reinforcement Learning for Autonomous Vessels

Nader Zare, Bruno Brandoli Machado|arXiv (Cornell University)|Jun 27, 2021
Maritime Navigation and Safety参考文献 27被引用 6
一句话总结

该论文提出了一种基于深度确定性策略梯度(DDPG)的连续船舶导航器(CVN),并引入一种新颖的状态-动作旋转(SAR)策略,以提升自主船舶路径规划中的泛化能力。通过旋转经验回放缓冲区中的状态-动作-状态转移并存储,该模型在蒙特利尔等未见过的地图上性能最高提升30.82%,且到达目的地率(RATD)提升11.96%。

ABSTRACT

Maritime autonomous transportation has played a crucial role in the globalization of the world economy. Deep Reinforcement Learning (DRL) has been applied to automatic path planning to simulate vessel collision avoidance situations in open seas. End-to-end approaches that learn complex mappings directly from the input have poor generalization to reach the targets in different environments. In this work, we present a new strategy called state-action rotation to improve agent's performance in unseen situations by rotating the obtained experience (state-action-state) and preserving them in the replay buffer. We designed our model based on Deep Deterministic Policy Gradient, local view maker, and planner. Our agent uses two deep Convolutional Neural Networks to estimate the policy and action-value functions. The proposed model was exhaustively trained and tested in maritime scenarios with real maps from cities such as Montreal and Halifax. Experimental results show that the state-action rotation on top of the CVN consistently improves the rate of arrival to a destination (RATD) by up 11.96% with respect to the Vessel Navigator with Planner and Local View (VNPLV), as well as it achieves superior performance in unseen mappings by up 30.82%. Our proposed approach exhibits advantages in terms of robustness when tested in a new environment, supporting the idea that generalization can be achieved by using state-action rotation.

研究动机与目标

  • 解决深度强化学习(DRL)智能体在多样化海洋环境中进行自主船舶导航时泛化能力差的挑战。
  • 通过旋转状态-动作转移的经验回放增强,提升在未见地理地图上的性能。
  • 利用原始图像输入开发连续控制策略,实现在复杂港口环境中实时、端到端的路径规划与障碍物避让。
  • 在哈利法克斯和蒙特利尔的真实地图上评估模型的鲁棒性与可迁移性,模拟动态起点与终点。
  • 证明将改进的弗洛伊德路径规划与陆地标注意RDP(LARDP)结合,可提升受限水道中学习效率与最终性能。

提出的方法

  • 采用深度确定性策略梯度(DDPG)算法,使用两个卷积神经网络(CNN):一个用于策略网络(演员),一个用于动作值网络(评论家),输入为原始图像。
  • 提出状态-动作旋转(SAR)策略:对经验回放缓冲区中的状态-动作-状态转移进行旋转,生成新的、多样化的训练经验,提升数据效率与泛化能力。
  • 使用局部视图生成器从完整地图中提取相关环境上下文,降低状态空间复杂度,提升规划效率。
  • 集成一个结合改进弗洛伊德算法与陆地标注意RDP(LARDP)的规划模块,为训练生成高质量的初始轨迹。
  • 在模拟港口环境中训练智能体,使用哈利法克斯与蒙特利尔的真实地理地图,设置动态起点与终点。
  • 采用经SAR增强的经验回放,稳定训练过程,并提升在新、未见地图上的泛化能力。

实验结果

研究问题

  • RQ1在经验回放缓冲区中应用状态-动作旋转,是否能显著提升DRL智能体在未见海洋环境中的泛化能力?
  • RQ2所提出的CVN模型结合SAR策略,在已见与未见地图上的到达目的地率(RATD)方面,相较于基线DRL模型(如VNPLV与DQN)表现如何?
  • RQ3将改进的弗洛伊德算法与LARDP规划相结合,能在多大程度上提升DRL智能体在复杂受限水道中的性能与学习效率?
  • RQ4采用原始图像输入与端到端CNN策略学习的方法,是否优于依赖手工特征或离散动作空间的传统方法?
  • RQ5当在更大、更复杂的地图(蒙特利尔)上测试时,该智能体的性能相较于训练地图(哈利法克斯)表现如何,特别是在使用SAR增强的情况下?

主要发现

  • 与基线VNPLV模型相比,CVN模型结合状态-动作旋转(SAR)在哈利法克斯地图上将到达目的地率(RATD)最高提升了11.96%。
  • 在未见的蒙特利尔地图上,CVN结合SAR策略相比基线模型,泛化性能提升达30.82%,RATD平均从2.02%提升至18.12%。
  • SAR策略显著增强了泛化能力,C2智能体在哈利法克斯上训练后,在蒙特利尔地图上表现几乎一致,表明对分布偏移具有强鲁棒性。
  • 集成改进弗洛伊德算法与LARDP规划分别使RATD提升4.42%与4.58%,证明在复杂环境中增强规划的有效性。
  • 起点与终点间最大距离越大,智能体在海峡与受限区域的探索越多,如密度图所示,表明在挑战性区域学习更充分。
  • CVN结合SAR在训练地图与未见地图上均优于所有其他配置(包括无旋转的配置),证实通过状态-动作旋转实现数据增强具有显著价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。