Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Reference Reinforcement Learning for Collision-Free Tracking Control of Autonomous Surface Vehicles

Qingrui Zhang, Wei Pan|arXiv (Cornell University)|2020. 08. 17.
Adaptive Dynamic Programming Control참고 문헌 54인용 수 6
한 줄 요약

이 논문은 모델 기반 강화학습(RL) 프레임워크를 제안하여 모델 불확실성 하에서 충돌 없는 궤적 추적을 달성하는 자율 표면선박(ASV)을 위한 방법을 제시한다. 명목 시스템 모델과 라플라스 기반 안정성 보장에 기반하여, 전체 시스템 동역학 지식이 필요로 하지 않으면서도 강건성, 샘플 효율성 향상 및 폐쇄 루프 안정성을 확보한다. 이는 전통적인 딥 강화학습보다 안정성과 수렴성 면에서 뛰어나다.

ABSTRACT

This paper presents a novel model-reference reinforcement learning algorithm for the intelligent tracking control of uncertain autonomous surface vehicles with collision avoidance. The proposed control algorithm combines a conventional control method with reinforcement learning to enhance control accuracy and intelligence. In the proposed control design, a nominal system is considered for the design of a baseline tracking controller using a conventional control approach. The nominal system also defines the desired behaviour of uncertain autonomous surface vehicles in an obstacle-free environment. Thanks to reinforcement learning, the overall tracking controller is capable of compensating for model uncertainties and achieving collision avoidance at the same time in environments with obstacles. In comparison to traditional deep reinforcement learning methods, our proposed learning-based control can provide stability guarantees and better sample efficiency. We demonstrate the performance of the new algorithm using an example of autonomous surface vehicles.

연구 동기 및 목표

  • 모델 불확실성과 알려지지 않은 수중역학 및 외란이 존재하는 자율 표면선박(ASV)에서 정확하고 충돌 없는 궤적 추적 문제를 해결하기 위해.
  • 시간 지연, 과도한 보수성 또는 높은 모델링 요구 사항으로 인해 성능이 떨어지는 전통적인 경로 계획 및 모델 기반 제어 방법의 한계를 극복하기 위해.
  • 폐쇄 루프 안정성과 강건성을 보장하면서도 모델 불확실성을 보완할 수 있는 학습 기반 제어 프레임워크를 개발하기 위해.
  • 기존 표준 딥 강화학습 접근 방식에 비해 샘플 효율성과 안정성을 향상시키기 위해.

제안 방법

  • 기본 추적 제어기를 설계하기 위해 전통적 제어 방법을 사용하여 명목 시스템 모델을 정의하며, 이는 장애물이 없는 환경에서의 바람직한 동작을 나타낸다.
  • 전체 제어기는 기본 제어기와 모델 불확실성 및 외란을 보완하는 데 학습하는 강화학습 모듈을 조합한다.
  • 추적 오차의 균일한 궁극적 유계성 보장을 위해 라플라스 기반 안정성 분석을 적용하여 불확실성 하에서도 폐쇄 루프 안정성을 확보한다.
  • 강화학습 에이전트는 안정적인 학습을 위해 재생 버퍼와 타겟 네트워크를 갖춘 쌍둥이 지연된 딥 결정성 정책 기반 강화학습(TD3) 알고리즘을 사용한다.
  • 비평가 네트워크는 상태-행동 가치를 평가하며, 작동자 네트워크는 제어 조작을 출력한다. 양자 모두 시간 차분 학습을 통해 할인 요소 γ = 0.998로 갱신된다.
  • 추적 오차와 장애물 근접도를 벌어지게 하는 보상 형태 함수를 도입하여 동시에 충돌 회피 및 궤적 추적을 가능하게 한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화학습 프레임워크는 최소한의 시스템 모델링 전제 조건 하에서 불확실한 ASV에 대해 안정적이고 충돌 없는 추적을 달성할 수 있는가?
  • RQ2제안된 방법은 ASV 제어에서 기존 표준 딥 강화학습에 비해 샘플 효율성과 안정성 면에서 어떻게 향상되는가?
  • RQ3RL 모듈은 평가되지 않은 동역학 및 환경 외란을 얼마나 잘 보완하면서도 폐쇄 루프 안정성을 유지할 수 있는가?
  • RQ4명목 제어기와 RL의 통합은 독립된 RL 또는 전통적 제어보다 더 높은 추적 정확도와 강건성을 달성할 수 있는가?

주요 결과

  • 제안된 모델 기반 강화학습 방법은 라플라스 분석을 통한 이론적 안정성 보장 하에 추적 오차의 균일한 궁극적 유계성을 달성한다.
  • 기존 표준 딥 강화학습 기준선에 비해 샘플 효율성이 향상되고 수렴 속도가 빠르게 나타났다.
  • 동적 환경에서 장애물을 성공적으로 회피하였으며, 복잡한 궤적을 추적하면서도 안전한 거리 유지를 유지하였다.
  • 시뮬레이션 결과는 추적 오차가 유계 영역 내에 유지됨을 보여주었으며, 제어 이득 조정을 통해 궁극적 유계를 조절할 수 있었다.
  • 불확실성 하에서 기존의 강건성 및 적응 제어 방법에 비해 일시적 반응(예: 과도한 피크 감소 및 수렴 시간 단축) 면에서 뛰어난 성능을 보였다.
  • 명목 시스템 모델의 사용은 더 나은 초기화와 수렴을 가능하게 하여 고차원 제어 공간에서의 불안정한 학습 위험을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.