Skip to main content
QUICK REVIEW

[論文レビュー] 2-Level Reinforcement Learning for Ships on Inland Waterways: Path Planning and Following

Martin Waltz, Niklas Paulig|arXiv (Cornell University)|Jul 25, 2023
Maritime Navigation and SafetyEngineering被引用数 3
ひとこと要約

本稿では、内陸水路における自律型水面航行艇(ASV)のための2段階の深層強化学習(DRL)フレームワークを提案する。高レベルの局所的経路計画(LPP)エージェントと低レベルの経路追従(PF)エージェントを組み合わせることで、安全で動的衝突回避と正確な軌道追従が可能になる。LPPエージェントは、最新の人工ポテンシャル場法に比べ、最小船舶間隔を65%向上させた。一方、PFエージェントは、PID制御に比べ、平均クロストラック誤差を39%削減し、制御効率も向上させた。実際のAISデータを用いて、エルベ川下流で検証された。

ABSTRACT

This paper proposes a realistic modularized framework for controlling autonomous surface vehicles (ASVs) on inland waterways (IWs) based on deep reinforcement learning (DRL). The framework improves operational safety and comprises two levels: a high-level local path planning (LPP) unit and a low-level path following (PF) unit, each consisting of a DRL agent. The LPP agent is responsible for planning a path under consideration of dynamic vessels, closing a gap in the current research landscape. In addition, the LPP agent adequately considers traffic rules and the geometry of the waterway. We thereby introduce a novel application of a spatial-temporal recurrent neural network architecture to continuous action spaces. The LPP agent outperforms a state-of-the-art artificial potential field (APF) method by increasing the minimum distance to other vessels by 65% on average. The PF agent performs low-level actuator control while accounting for shallow water influences and the environmental forces winds, waves, and currents. Compared with a proportional-integral-derivative (PID) controller, the PF agent yields only 61% of the mean cross-track error (MCTE) while significantly reducing control effort (CE) in terms of the required absolute rudder angle. Lastly, both agents are jointly validated in simulation, employing the lower Elbe in northern Germany as an example case and using real automatic identification system (AIS) trajectories to model the behavior of other ships.

研究の動機と目的

  • 自律型水面航行艇(ASV)が内陸水路(IWs)で動的衝突回避を実現するための課題に応えること。既存のDRL手法は静的障害物や開放水域に焦点を当てており、動的障害物への適応が不十分である。
  • 局所的経路計画(LPP)と低レベルの経路追従(PF)を分離することで、スケーラブルで安全なナビゲーションを実現する、モジュラーな2段階DRLアーキテクチャを開発すること。
  • 交通ルール、水路の幾何学的形状、環境的力(海流、風、波)および浅水域効果といった、現実世界の制約を制御フレームワークに統合すること。
  • 実際の自動識別システム(AIS)トラジェクトリから得たエルベ川下流のデータを用いて、動的船舶を含む現実的な遭遇状況をシミュレートし、システムを検証すること。
  • 人工ポテンシャル場法やPID制御といった従来の手法に比べ、衝突回避性能と追従精度の両面で優れた性能を示すことを実証すること。

提案手法

  • 本フレームワークは2段階のDRLアーキテクチャを採用する。高レベルのLPPエージェントは、連続的アクション空間制御のための空間的・時間的再帰的ニューラルネットワークを用い、低レベルのPFエージェントは正確なアクチュエータ制御を実現する。
  • LPPエージェントは、動的標的船舶、水路の幾何学的形状、交通ルールを考慮してリアルタイムで経路を計画する。衝突や浅瀬への座礁を罰する独自の報酬関数を用いる。
  • PFエージェントは、海流、風、波などの環境的摂動を考慮しながら、操舵角をDRLエージェントが制御し、クロストラック誤差を最小化する。
  • 両エージェントは、エルベ川下流を基盤とするシミュレーション環境で、実際のAISデータを用いて標的船舶の行動をモデル化し、エンドツーエンドで訓練される。
  • 空間的・時間的アーキテクチャにより、LPPエージェントは、船舶の位置や水深などの逐次的空間的観測を処理し、合理的な航路決定が可能になる。
  • 本システムは、実際のAISトラジェクトリを用いて評価され、頭合わせや追い越しなどの多様な遭遇状況で検証された。

実験結果

リサーチクエスチョン

  • RQ1DRLに基づく2段階アーキテクチャは、複雑な内陸水路環境におけるASVの動的衝突回避をどのように改善できるか?
  • RQ2提案されたLPPエージェントは、従来の人工ポテンシャル場(APF)法に比べ、動的船舶からの安全距離をどの程度向上させられるか?
  • RQ3環境的摂動下で、DRLに基づくPFエージェントは、従来のPID制御に比べ、追従精度と制御効率の両面でどの程度優れているか?
  • RQ4実際のAISトラジェクトリを用いてシミュレートされたデータで学習した2段階DRLフレームワークは、実世界の状況に一般化可能か?
  • RQ5交通ルール、水路の幾何学的形状、環境的力は、自律航行システムの性能と安全性にどのような影響を及ぼすか?

主な発見

  • LPPエージェントは、最新の人工ポテンシャル場(APF)法に比べ、他の船舶との最小距離を平均で65%向上させ、衝突回避性能が顕著に向上した。
  • PFエージェントは、平均クロストラック誤差(MCTE)をPIDコントローラーが達成した値の61%まで低減し、優れた経路追従精度を示した。
  • DRLに基づくPFエージェントは、必要な絶対的操舵角を著しく低減することで、制御効率を向上させ、燃料効率の向上と滑らかな制御を示した。
  • 2段階システムは、実際のAISデータを用いて、頭合わせや追い越しといった複雑な現実世界の遭遇状況を効果的に処理でき、強靭性と適応性を示した。
  • 本フレームワークは、海流、風、波、浅水域効果といった環境的力を制御方策に効果的に統合し、現実性と安全性を高めた。
  • 本システムは、速度や交通密度の変動にかかわらず高い性能を維持でき、多様な運用条件下での一般化能力を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。