Skip to main content
QUICK REVIEW

[논문 리뷰] Online Constrained Model-based Reinforcement Learning

Benjamin van Niekerk, Andreas Damianou|arXiv (Cornell University)|2020. 04. 07.
Gaussian Processes and Bayesian Inference참고 문헌 9인용 수 10
한 줄 요약

이 논문은 연속적인 로봇 환경에서 빠르고 안전하며 적응적인 학습을 가능하게 하는 데이터 효율적인 온라인 모델 기반 강화 학습 방법인 가우시안 프로세스-후행 수평 제어(GP-RHC)를 제안한다. 이 방법은 스parse spectrum 가우시안 프로세스를 사용해 동적 모델을 점진적으로 학습하고, 후행 수평 제어를 통해 실시간 제약 조건을 고려한 계획을 수행한다. 이를 통해 랩 타임을 3.86% 단축시키고, 온라인 모델 업데이트를 통해 제약 조건 처리 능력을 향상시킨다.

ABSTRACT

Applying reinforcement learning to robotic systems poses a number of challenging problems. A key requirement is the ability to handle continuous state and action spaces while remaining within a limited time and resource budget. Additionally, for safe operation, the system must make robust decisions under hard constraints. To address these challenges, we propose a model based approach that combines Gaussian Process regression and Receding Horizon Control. Using sparse spectrum Gaussian Processes, we extend previous work by updating the dynamics model incrementally from a stream of sensory data. This results in an agent that can learn and plan in real-time under non-linear constraints. We test our approach on a cart pole swing-up environment and demonstrate the benefits of online learning on an autonomous racing task. The environment's dynamics are learned from limited training data and can be reused in new task instances without retraining.

연구 동기 및 목표

  • 연속적인 상태 공간과 행동 공간에서 로봇 강화 학습의 데이터 효율성과 실시간 계획 문제를 해결하기 위해.
  • 트랙 경계 및 장애물 회피와 같은 딱딱한 비선형 제약 조건 하에서도 안전한 운영을 가능하게 하기 위해.
  • 스트리밍 센서 데이터로부터 온라인 모델 업데이트를 지원하여 학습 속도와 내성 강도를 향상시키기 위해.
  • 재학습 없이도 학습된 동적 모델을 새로운 작업에 재사용할 수 있도록 하여 이전성(transferability)을 향상시키기 위해.
  • 자율 레이싱과 같은 고속·안전 중심의 로봇 작업에 적용 가능성을 입증하기 위해.

제안 방법

  • 스트리밍 센서 데이터로부터 동적 모델을 학습하고 점진적으로 업데이트하기 위해 스parse spectrum 가우시안 프로세스(SSGPs)를 사용한다.
  • 제약 조건 하에서 실시간 최적화를 수행하기 위해 내부점 해법기(FORCES)를 사용한 후행 수평 제어(RHC)를 적용한다.
  • 최적화 과정에서 불가능성이 발생하는 것을 방지하기 위해 경비 함수에 페널티를 적용한 슬랙 변수를 사용해 딱딱한 제약 조건을 부드럽게 한다.
  • 학습된 동적 모델을 RHC와 통합하여 연속적이고 제약 조건이 있는 환경에서 온라인 계획 및 제어를 가능하게 한다.
  • 최신 상태 추정치와 업데이트된 모델을 사용해 매 시간 단계마다 재계획하는 유한 수평 최적화 프레임워크를 적용한다.
  • 초기 동적 모델을 학습하기 위해 단순 타원형 트랙에서 70개의 데이터 포인트를 사용하였으며, 이는 재학습 없이도 복잡한 새로운 트랙으로 일반화된다.

실험 결과

연구 질문

  • RQ1스parse spectrum 가우시안 프로세스를 사용한 온라인 학습이 로봇 모델 기반 강화 학습의 데이터 효율성과 학습 속도를 향상시킬 수 있는가?
  • RQ2부드럽게 처리된 제약 조건을 가진 후행 수평 제어가 실시간 로봇 제어에서 복잡한 비선형 제약 조건을 처리할 수 있는가?
  • RQ3온라인 모델 업데이트가 학습 과정에서 수렴 속도 향상과 제약 위반 감소에 기여하는가?
  • RQ4단순한 트랙에서 학습된 동적 모델이 재학습 없이 더 복잡한 작업에 얼마나 잘 재사용될 수 있는가?
  • RQ5온라인 모델 적응이 고속 자율 레이싱 작업 성능에 어떤 영향을 미치는가?

주요 결과

  • 온라인 모델 업데이트를 사용할 경우, 랩 타임이 2.745초에서 2.639초로 3.86% 단축되었다.
  • 단지 단순 타원형 트랙에서 70개의 데이터 포인트로 학습된 모델이 날카로운 구간이 많은 복잡한 레이싱 트랙으로도 성공적으로 일반화되었다.
  • 제어 단계당 최대 30회의 SQP 반복을 사용해 실시간 계획을 달성하였다.
  • 온라인 업데이트가 학습 과정에서 제약 위반을 크게 감소시켜 안전성과 일관성을 향상시켰다.
  • 동일한 학습된 동적 모델을 재학습 없이도 레이싱과 장애물 회피 등의 다양한 작업에 재사용할 수 있었다.
  • 트랙을 311m로 확장했을 경우, 온라인 업데이트를 사용해 랩 타임이 4.56초 단축되었으며, 이는 평균 속도가 16.4 km/h 증가한 것과 동일한 효과를 가졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.