Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning-Based Automatic Berthing System

Dae-Soo Lee|arXiv (Cornell University)|Dec 3, 2021
Maritime Navigation and Safety被引用数 6
ひとこと要約

本稿では、事前収集されたバースティングデータの大量を必要としない強化学習ベースの自動バースティングシステムを提案する。シミュレーテッド海上環境との試行錯誤的相互作用を通じてエージェントを訓練することで、舵角と秒間回転数(RPS)の最適制御方策を学習し、さまざまな初期状態、特に学習分布外の外挿された状況においても、頑健なバースティング性能を達成する。

ABSTRACT

Previous studies on automatic berthing systems based on artificial neural network (ANN) showed great berthing performance by training the ANN with ship berthing data as training data. However, because the ANN requires a large amount of training data to yield robust performance, the ANN-based automatic berthing system is somewhat limited due to the difficulty in obtaining the berthing data. In this study, to overcome this difficulty, the automatic berthing system based on one of the reinforcement learning (RL) algorithms, proximal policy optimization (PPO), is proposed because the RL algorithms can learn an optimal control policy through trial-and-error by interacting with a given environment and does not require any pre-obtained training data, where the control policy in the proposed PPO-based automatic berthing system controls revolutions per second (RPS) and rudder angle of a ship. Finally, it is shown that the proposed PPO-based automatic berthing system eliminates the need for obtaining the training dataset and shows great potential for the actual berthing application.

研究の動機と目的

  • 既存の人工ニューラルネットワーク(ANN)ベースの自動バースティングシステムでは、トレーニングに大量の実際のバースティングデータを必要としているため、データ不足の制限を克服すること。
  • 強化学習(RL)を用いて、シミュレーテッド環境との相互作用を通じて最適制御方策を学習するデータ効率の良い自動バースティングソリューションを開発すること。
  • PPOベースのエージェントが学習分布外の初期状態にも一般化できることを示し、実世界応用における頑健性を確保すること。
  • 事前に船舶の操船ダイナミクスを理解していない状態でも、適切に設計された報酬関数が望ましいバースティング行動を導くことができることを検証すること。

提案手法

  • 本システムは、状態から行動へのマッピングを学習するニューラルネットワーク方策を訓練するために、深層強化学習アルゴリズムであるPPO(Proximal Policy Optimization)を採用する。
  • 状態表現には、正規化された船舶の位置(η, ξ)、ヘディング角(ψ)、目的までの距離(d)、および全進、横 sway、ヨー方向の速度(u, v, r)を含む。
  • 行動は、舵角(δ)と秒間回転数(n)として定義され、物理的制限内に制約される:1 ≤ n ≤ 1、-35° ≤ δ ≤ 35°、|dδ/dt| ≤ 3°/s。
  • 収束を促進し、距離、角度ずれ、制御努力をペナルティ化するように設計された密集型で形状化された報酬関数が採用される。
  • 連続的な状態空間と行動空間を持つマルコフ決定過程(MDP)フレームワークを用いて、シミュレーテッド海上環境でエージェントを訓練する。
  • 約20時間のトレーニング期間中に、PPOアルゴリズムを用いてNステップごとに方策を更新し、トレーニング結果は軌道シミュレーションを用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1PPOベースの強化学習エージェントは、事前に収集されたバースティングデータセットに依存せずに、頑健なバースティング方策を学習できるか?
  • RQ2学習中に使用された範囲外の初期船舶位置に対し、トレーニング済みのPPOエージェントはどの程度一般化できるか?
  • RQ3報酬関数は、船舶ダイナミクスの事前知識なしに、安全かつ効率的なドッキングを達成するようにバースティング行動をどの程度形状づけられるか?
  • RQ4PPOベースのシステムは、広範な初期条件の下で一貫性があり安定したバースティング性能を達成できるか?

主な発見

  • PPOベースの自動バースティングシステムは、環境との相互作用を通じて最適制御方策を効果的に学習し、事前に収集されたバースティングデータの一切を不要とした。
  • 本システムは、学習分布外の初期位置を含む多様な初期位置においても頑健な性能を示し、強力な一般化能力を示した。
  • 報酬履歴は約20時間のトレーニング後に収束したため、PPOアルゴリズムが安定かつ最適な方策に到達したことが示された。
  • シミュレーション上のバースティング軌道は、極端な初期設定からでも正確かつ滑らかに目的地点に収束しており、過剰応答や振動が最小限に抑えられていた。
  • 複数のテストケースにおいて一貫したバースティング性能が達成され、すべてのテストシナリオ、特に外挿された初期状態においても正常なドッキングが観測された。
  • オープンソースのシミュレーションコードと事前学習済みモデルはGitHubで公開されており、再現性とさらなる研究を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。