Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Reference Reinforcement Learning Control of Autonomous Surface Vehicles with Uncertainties

Qingrui Zhang, Wei Pan|arXiv (Cornell University)|2020. 03. 30.
Reinforcement Learning in Robotics참고 문헌 32인용 수 10
한 줄 요약

이 논문은 전통적인 기준 제어 법칙과 딥 강화 학습을 조합하여 불확실한 자율 표면 항선(ASV)의 안정성과 궤적 추적 성능을 향상시키는 모델-기반 강화 학습 제어 프레임워크를 제안한다. 전통적 제어의 안정성 보장과 딥 RL의 적응형 보정 기능을 융합함으로써, 더 빠른 수렴 속도, 높은 샘플 효율성, 그리고 폐쇄 루프 안정성을 달성하였다. 시뮬레이션을 통해 순수한 RL 또는 기준 제어법만을 사용한 경우와 비교해 우수한 추적 성능과 안정성을 입증하였다.

ABSTRACT

This paper presents a novel model-reference reinforcement learning control method for uncertain autonomous surface vehicles. The proposed control combines a conventional control method with deep reinforcement learning. With the conventional control, we can ensure the learning-based control law provides closed-loop stability for the overall system, and potentially increase the sample efficiency of the deep reinforcement learning. With the reinforcement learning, we can directly learn a control law to compensate for modeling uncertainties. In the proposed control, a nominal system is employed for the design of a baseline control law using a conventional control approach. The nominal system also defines the desired performance for uncertain autonomous vehicles to follow. In comparison with traditional deep reinforcement learning methods, our proposed learning-based control can provide stability guarantees and better sample efficiency. We demonstrate the performance of the new algorithm via extensive simulation results.

연구 동기 및 목표

  • 비선형 수역역학과 알려지지 않은 환경적 외란에 노출된 자율 표면 항선(ASV)의 궤적 추적 문제를 해결하기 위해.
  • 순수한 딥 강화 학습의 한계, 즉 폐쇄 루프 안정성 부족과 낮은 샘플 효율성 문제를 해결하기 위해.
  • 전통적 제어와 딥 RL을 통합하여 시스템 안정성을 확보하면서도 모델 불확실성에 대한 적응형 보정을 가능하게 하기 위해.
  • 명시된 시스템을 기준으로 학습을 수행함으로써 샘플 효율성과 추적 정확도를 향상시키기 위해.
  • 지속적인 교란이 필요 없으며 불확실성의 범위에 대한 사전 지식이 필요 없는 안정적이고 데이터 기반의 제어 솔루션을 제공하기 위해.

제안 방법

  • 전체 시스템의 폐쇄 루프 안정성을 보장하기 위해, 전통적 제어 방법을 사용하여 기준 제어 법칙을 설계하기 위해 명시된 시스템을 정의한다.
  • 기준 제어 법칙은 ASV의 선형화 모델을 기반으로 하며, 이는 이득 행렬 G와 H를 사용하는 상태 피드백 제어기로 유도된다.
  • 딥 강화 학습은 명시된 모델이 포괄하지 못하는 모델 불확실성과 외란을 보정하기 위한 보정 제어 법칙을 학습하는 데 사용된다.
  • 학습 과정은 역사적 데이터를 기반으로 오프라인으로 수행되며, 확률적 경사 하강법을 사용하여 실시간 배포 시 지속적인 교란이 필요 없도록 한다.
  • 전체 제어 입력은 기준 제어와 딥 RL이 생성한 보정의 합으로 구성되며, 하이브리드 제어 아키텍처를 형성한다.
  • 리아푸노프 기반 안정성 분석을 통해, 불확실성 존재 하에서도 병합된 제어 법칙이 시스템 안정성을 유지하도록 보장한다.

실험 결과

연구 질문

  • RQ1기존 제어와 딥 강화 학습을 융합한 하이브리드 제어 프레임워크는 불확실한 ASV에 대해 폐쇄 루프 안정성을 확보할 수 있는가?
  • RQ2기준 제어 법칙의 도입이 ASV 제어에서 딥 강화 학습의 샘플 효율성에 어떤 영향을 미치는가?
  • RQ3모델링 불확실성이 존재할 경우, 딥 RL은 기준 제어법만을 사용한 경우에 비해 궤적 추적 성능을 얼마나 향상시킬 수 있는가?
  • RQ4재학습 없이도 기준 궤적의 변화가 발생할 경우, 제안된 방법은 안정성과 성능을 유지할 수 있는가?
  • RQ5주어진 주파수나 구조에 대한 사전 지식 없이도, 이 방법은 불일치하는 불확실성과 외란을 보상할 수 있는가?

주요 결과

  • 제안된 방법은 순수한 딥 RL보다 더 빠른 수렴 속도와 더 높은 장기적 수익을 달성하여 샘플 효율성이 향상됨을 입증하였다.
  • 기준 제어의 도입으로 기준 제어법 전용 대비 평균 절대 거리 오차가 약 50% 감소하여 추적 정확도가 크게 향상되었다.
  • 첫 번째 평가에서 제안된 방법은 200초 동안 안정적인 궤적 추적을 확보하였고, 순수한 RL은 안정성을 유지하지 못했다.
  • 기준 궤적이 변경된 두 번째 평가에서는 제안된 방법이 기준 제어법과 순수한 RL 모두를 능가하는 추적 정확도를 유지하며 폐쇄 루프 안정성을 확보하였다.
  • 학습 곡선 분석 결과, 제안된 알고리즘이 순수한 RL 기준 대비 더 높은 수익 값을 더 빨리 수렴하는 것으로 나타나 샘플 효율성이 향상되었음을 확인하였다.
  • 주어진 주파수나 구조에 대한 사전 지식 없이도, 이 방법은 불일치하는 불확실성과 외란을 성공적으로 보상하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.