Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Ship Autopilot: Sample efficient and Model Predictive Control-based Approach

Yunduan Cui, Shigeki Osaki|arXiv (Cornell University)|2019. 01. 23.
Reinforcement Learning in Robotics참고 문헌 31인용 수 7
한 줄 요약

이 논문은 실제 크기의 보트를 위한 샘플 효율적이고 견고한 자율 항법 제어를 가능하게 하는 모델기반 강화학습 접근법인 샘플 효율적 확률적 모델 예측 제어(Sample-Efficient Probabilistic Model Predictive Control, SPMPC)를 제안한다. 이는 가우시안 프로세스 동역학 모델링과 반복적 MPC를 결합하여 실해양 환경에서 최소한의 인간 지시로 안정적인 목표 추적을 실현하며, 단지 600회의 환경 상호작용으로 4분 이내에 목표를 추적하는 데 성공한다.

ABSTRACT

In this research we focus on developing a reinforcement learning system for a challenging task: autonomous control of a real-sized boat, with difficulties arising from large uncertainties in the challenging ocean environment and the extremely high cost of exploring and sampling with a real boat. To this end, we explore a novel Gaussian processes (GP) based reinforcement learning approach that combines sample-efficient model-based reinforcement learning and model predictive control (MPC). Our approach, sample-efficient probabilistic model predictive control (SPMPC), iteratively learns a Gaussian process dynamics model and uses it to efficiently update control signals within the MPC closed control loop. A system using SPMPC is built to efficiently learn an autopilot task. After investigating its performance in a simulation modeled upon real boat driving data, the proposed system successfully learns to drive a real-sized boat equipped with a single engine and sensors measuring GPS, speed, direction, and wind in an autopilot task without human demonstration.

연구 동기 및 목표

  • 실제 보트 자율주행에서 높은 샘플 비용과 환경 불확실성(예측 불가능한 바람, 해류, 센서 노이즈 등)을 해결하기 위해.
  • 실제 크기의 무인 표면 항공기용으로 적합한, 인간 지시 없이도 견고한 제어 정책을 학습할 수 있는 강화학습 시스템을 개발하기 위해.
  • 모델기반 RL과 가우시안 프로세스, MPC를 융합하여 동적 해양 환경에서 샘플 효율성과 실시간 견고성을 향상시키기 위해.
  • 고정밀 시뮬레이션(실제 보트 데이터로 校정된)과 실제 해양 환경에서의 실물 보트에서의 실험을 통해 시스템을 검증하기 위해.
  • 단일 엔진, 센서 장착 보트가 오직 RL 기반 정책 학습만으로도 자율적으로 목표 위치에 도달하고 유지할 수 있음을 입증하기 위해.

제안 방법

  • SPMPC는 보트의 동역학을 베이지안 프레임워크 내에서 불확실성을 포괄하는 희소 가우시안 프로세스(GP)로 모델링한다.
  • RL 롤아웃 동안 수집된 데이터를 반복적으로 활용하여 GP 모델을 개선함으로써 예측 정확도를 점차 향상시킨다.
  • 유한한 예측 시간 간격을 가진 모델 예측 제어(MPC) 프레임워크를 사용하여 실시간 피드백과 외란 제거를 가능하게 한다.
  • 상태 추정 및 제어 입력의 체계적 오차를 보정하기 위해 GP 모델에 편향 보정을 구현한다.
  • 목표 지점까지의 유클리드 거리 기반 비용 함수를 사용하며, 예측 시간 간격 H=5단계 동안 최적화를 수행한다.
  • 탐색과 이용의 균형을 이루기 위해 50% 랜덤 동작과 50% 정책 기반 탐색을 조합한 하이브리드 데이터 수집 전략을 사용한다.

실험 결과

연구 질문

  • RQ1실제 데이터 수집 비용이 높은 환경에서, GP 기반 동역학 모델링을 갖춘 모델기반 RL 접근법이 보트 자율주행에서 샘플 효율성을 달성할 수 있는가?
  • RQ2GP의 불확실성과 MPC 피드백의 통합이 바람과 해류와 같은 예측 불가능한 해양 외란에 대해 얼마나 뛰어난 견고성을 제공하는가?
  • RQ3인간 지시 없이도 실해양 환경에서 오직 강화학습에 의존하여 안정적인 자율항법 정책을 학습할 수 있는가?
  • RQ4다양한 수의 의사 입력(pseudo-inputs)을 사용할 경우, 희소 GP의 계산 효율성과 모델 정확성 사이의 상호 교환 관계는 어떠한가?
  • RQ5실제 환경 조건에서 GP 모델의 편향 보정이 제어 성능 향상에 얼마나 기여하는가?

주요 결과

  • SPMPC 시스템은 실물 크기의 보트를 목표 위치 [100,100]으로 약 3.5분 만에 도달시키며, 단지 600회의 환경 상호작용으로 성공적으로 학습하였다.
  • 500개의 의사 입력을 사용할 경우 GP 모델의 평균 롤아웃 오차는 64.46미터였고, 50개의 의사 입력을 사용할 경우 오차는 121.03미터로 증가했지만 추론 시간은 1.55초로 크게 단축되었다.
  • 시스템은 바람(2 m/s, 135°)과 해류(0.0–0.2 m/s, 45°)와 같은 실제 해양 외란에 대해 뛰어난 견고성을 보였으며, 환경의 변동성에도 불구하고 목표 지점에 근접한 상태를 유지하였다.
  • GP 모델에 편향 보정을 적용함으로써 제어 성능이 크게 향상되었으며, 사전 인간 지시 없이도 안정적인 추적을 가능하게 하였다.
  • RL 과정에서 수렴이 20단계 이내(약 2.5분)에 달성되어 매우 뛰어난 샘플 효율성을 입증하였다.
  • 실생활 실험을 통해 SPMPC 프레임워크가 제한된 하드웨어 조건에서도 실시간으로 계산 가능하고 안정적인 자율항법 운영을 가능하게 함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.