Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning-Based Automatic Berthing System

Dae-Soo Lee|arXiv (Cornell University)|2021. 12. 03.
Maritime Navigation and Safety인용 수 6
한 줄 요약

이 논문은 사전에 수집된 대량의 기항 데이터가 필요 없도록, Proximal Policy Optimization (PPO)를 기반으로 한 강화학습 기반의 자동 기항 시스템을 제안한다. 시뮬레이션된 해양 환경에서의 시행착오적 상호작용을 통해 에이전트를 훈련시켜 조타각과 초당 회전수(RPS)에 대한 최적의 제어 정책을 학습함으로써, 다양한 초기 조건, 특히 훈련 분포를 초월한 외삽 시나리오에서도 견고한 기항 성능을 달성한다.

ABSTRACT

Previous studies on automatic berthing systems based on artificial neural network (ANN) showed great berthing performance by training the ANN with ship berthing data as training data. However, because the ANN requires a large amount of training data to yield robust performance, the ANN-based automatic berthing system is somewhat limited due to the difficulty in obtaining the berthing data. In this study, to overcome this difficulty, the automatic berthing system based on one of the reinforcement learning (RL) algorithms, proximal policy optimization (PPO), is proposed because the RL algorithms can learn an optimal control policy through trial-and-error by interacting with a given environment and does not require any pre-obtained training data, where the control policy in the proposed PPO-based automatic berthing system controls revolutions per second (RPS) and rudder angle of a ship. Finally, it is shown that the proposed PPO-based automatic berthing system eliminates the need for obtaining the training dataset and shows great potential for the actual berthing application.

연구 동기 및 목표

  • 기존의 인공신경망(ANN) 기반 자동 기항 시스템에서 발생하는 데이터 부족 문제를 해결하기 위해, 훈련에 대량의 실제 기항 데이터가 필요로 하는 문제를 해결한다.
  • 강화학습(RL)을 활용하여 시뮬레이션된 환경과의 상호작용을 통해 최적의 제어 정책을 학습하는 데이터 효율적인 자동 기항 솔루션을 개발한다.
  • PPO 기반 에이전트가 훈련 분포를 초월한 초기 조건에도 일반화할 수 있음을 입증하여 실세계 적용에서의 견고성을 확보한다.
  • 선박 조종 동역학에 대한 사전 지식 없이도 잘 설계된 보상 함수가 에이전트가 원하는 기항 행동으로 유도할 수 있음을 검증한다.

제안 방법

  • 시스템은 상태를 행동으로 매핑하는 신경망 정책를 훈련시키기 위해 깊이 강화학습 알고리즘인 Proximal Policy Optimization (PPO)를 사용한다.
  • 상태 표현은 정규화된 선박 위치(η, ξ), 헤딩 각도(ψ), 목표까지의 거리(d), 그리고 추진력, 횡이동, 요동 방향의 속도(u, v, r)를 포함한다.
  • 행동는 조타각(δ)과 초당 회전수(n)로 정의되며, 물리적 제약 조건에 따라 제한된다: 1 ≤ n ≤ 1, -35° ≤ δ ≤ 35°, |dδ/dt| ≤ 3°/s.
  • 밀도 높은 보상 함수를 설계하여 목표 지점으로의 수렴을 장려하고, 거리, 각도 편차, 제어 노력에 대해 벌점을 적용한다.
  • 연속적인 상태 및 행동 공간을 갖는 마르코프 결정 과정(MDP) 프레임워크를 사용하여 시뮬레이션된 해양 환경에서 에이전트를 훈련한다.
  • 약 20시간 동안 훈련을 수행하며, PPO 알고리즘을 사용해 N단계마다 정책 업데이트를 실시하고, 궤적 시뮬레이션을 통해 결과를 평가한다.

실험 결과

연구 질문

  • RQ1PPO 기반 강화학습 에이전트는 사전에 수집된 기항 데이터셋에 의존하지 않고 견고한 기항 정책을 학습할 수 있는가?
  • RQ2훈련 시 사용된 범위를 초월한 초기 선박 위치에 대해 훈련된 PPO 에이전트의 일반화 능력은 어느 정도인가?
  • RQ3보상 함수가 선박 동역학에 대한 사전 지식 없이도 안전하고 효율적인 도킹을 위한 기항 행동을 얼마나 잘 유도할 수 있는가?
  • RQ4PPO 기반 시스템은 다양한 초기 조건에 걸쳐 일관되고 안정적인 기항 성능을 달성하는가?

주요 결과

  • PPO 기반 자동 기항 시스템은 환경과의 상호작용을 통해 최적의 제어 정책을 성공적으로 학습하여 사전에 수집된 기항 데이터가 전혀 필요 없음을 입증했다.
  • 훈련 분포를 초월한 다양한 초기 위치에서도 견고한 성능을 보였으며, 이는 강력한 일반화 능력을 나타낸다.
  • 약 20시간의 훈련 후 보상 시간 이력이 수렴함으로써 PPO 알고리즘이 안정적이고 최적의 정책에 도달했음을 나타낸다.
  • 시뮬레이션된 기항 궤적은 극단적인 초기 설정에서도 목표 지점으로 정확하고 부드럽게 수렴했으며, 과도한 오버슈트나 진동이 최소화되었다.
  • 다양한 테스트 케이스에서 일관된 기항 성능을 보였으며, 모든 테스트 시나리오, 특히 외삽된 초기 상태에서도 성공적인 도킹이 관찰되었다.
  • 오픈소스 시뮬레이션 코드와 사전 훈련된 모델은 GitHub에 공개되어 있어 재현성과 향후 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.