Skip to main content
QUICK REVIEW

[論文レビュー] Continuous Control with Deep Reinforcement Learning for Autonomous Vessels

Nader Zare, Bruno Brandoli Machado|arXiv (Cornell University)|Jun 27, 2021
Maritime Navigation and Safety参考文献 27被引用数 6
ひとこと要約

本稿では、深層決定的方策勾配(DDPG)を用い、新たな状態行動回転(SAR)戦略を導入した連続的ボートナビゲーター(CVN)を提案する。この戦略により、経験遷移(状態-行動-状態)を回転させ、リプレイバッファに格納することで、モンタリオなど未学習のマップにおいて、ベースライン手法と比較して最大30.82%の性能向上が達成され、目的地到着率(RATD)も11.96%向上した。

ABSTRACT

Maritime autonomous transportation has played a crucial role in the globalization of the world economy. Deep Reinforcement Learning (DRL) has been applied to automatic path planning to simulate vessel collision avoidance situations in open seas. End-to-end approaches that learn complex mappings directly from the input have poor generalization to reach the targets in different environments. In this work, we present a new strategy called state-action rotation to improve agent's performance in unseen situations by rotating the obtained experience (state-action-state) and preserving them in the replay buffer. We designed our model based on Deep Deterministic Policy Gradient, local view maker, and planner. Our agent uses two deep Convolutional Neural Networks to estimate the policy and action-value functions. The proposed model was exhaustively trained and tested in maritime scenarios with real maps from cities such as Montreal and Halifax. Experimental results show that the state-action rotation on top of the CVN consistently improves the rate of arrival to a destination (RATD) by up 11.96% with respect to the Vessel Navigator with Planner and Local View (VNPLV), as well as it achieves superior performance in unseen mappings by up 30.82%. Our proposed approach exhibits advantages in terms of robustness when tested in a new environment, supporting the idea that generalization can be achieved by using state-action rotation.

研究の動機と目的

  • 多様な海洋環境における自律的ボートナビゲーションのための深層強化学習(DRL)エージェントの一般化性能が低いという課題に対処すること。
  • 未学習の地理的マップにおける性能を向上させるために、状態行動遷移の回転拡張を用いた経験リプレイの強化を行うこと。
  • 生画像入力を用いて、リアルタイムでエンドツーエンドの経路計画と障害物回避を実現する連続的制御方策を開発すること。
  • ハリファックスおよびモントリオールの実世界マップを用い、動的な出発点と到着点を想定して、モデルの頑健性と移行性を評価すること。
  • 修正 Floyd 経路計画と Land-Attended RDP(LARDP)を組み合わせることで、制限付き水路における学習効率と最終的性能が向上することを実証すること。

提案手法

  • 生画像入力を用い、エージェントの行動方策(エージェント)と行動価値(クライアント)をそれぞれ2つの畳み込みニューラルネットワーク(CNN)で実装した深層決定的方策勾配(DDPG)を採用する。
  • 状態行動回転(SAR)戦略を導入:リプレイバッファに格納された状態行動状態遷移を回転させ、新たな多様な学習経験を生成することで、データ効率と一般化性能を向上させる。
  • 局所的ビュー生成モジュールを用い、全体マップから関連する環境的文脈を抽出することで、状態空間の複雑さを低減し、計画効率を向上させる。
  • 修正 Floyd アルゴリズムと Land-Attended RDP(LARDP)を統合したプランナーモジュールを導入し、訓練用に高品質な初期経路を生成する。
  • ハリファックスおよびモントリオールの実地理的マップを用い、動的な出発点と到着点を想定して、シミュレーテッド港環境でエージェントを訓練する。
  • SAR拡張遷移を用いた経験リプレイを適用することで、学習の安定化と未学習マップへの一般化性能の向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1リプレイバッファにおける状態行動回転が、未学習の海洋環境における自律的ボートナビゲーションのDRLエージェントの一般化性能を顕著に向上させるか?
  • RQ2提案されたCVNモデル(SARを含む)は、ハリファックスおよびモントリオールの両マップにおいて、ベースラインDRLモデル(例:DQNを用いたVNPLV)と比較して、目的地到着率(RATD)にどのような差を生じるか?
  • RQ3修正 Floyd と LARDP の統合は、複雑で制限のある水路環境におけるDRLエージェントの性能と学習効率をどの程度向上させるか?
  • RQ4エンドツーエンドのCNNベースの行動方策学習に生画像入力を用いることで、従来のハンドクラフト特徴量や離散的行動空間依存の手法を上回る性能が得られるか?
  • RQ5SAR拡張を用いた場合、訓練マップ(ハリファックス)とは異なる、より大規模で複雑なマップ(モントリオール)でテストした際のエージェントの性能はどの程度頑健か、特に分布シフトに対する耐性はいかがなものか?

主な発見

  • SARを用いたCVNモデルは、ハリファックスマップにおいて、VNPLVベースラインと比較して、目的地到着率(RATD)を最大11.96%向上させた。
  • 未学習のモントリオールマップでは、SARを用いたCVNがベースライン比で30.82%の一般化性能向上を達成し、RATDは平均で2.02%から18.12%に上昇した。
  • SAR戦略は一般化性能を顕著に向上させた。ハリファックスで学習したC2エージェントは、モントリオールでもほぼ同等の性能を示し、分布シフトに対する強い頑健性を示した。
  • 修正 Floyd と LARDP の統合により、それぞれRATDが4.42%および4.58%向上し、複雑な環境における高品質な計画の有効性が裏付けられた。
  • 出発点と到着点の最大距離が大きいほど、密度マップから示されるように、海峡や制限区域の探索が顕著に増加した。これは、挑戦的な領域での学習がより効果的に行われたことを示している。
  • SARを用いたCVNは、回転なしの他のすべての構成と比較して、訓練マップおよび未学習マップの両方で優れた性能を示し、状態行動回転によるデータ拡張の価値を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。