Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Model-based Reinforcement Learning with Robust Cross-Entropy Method.

Zuxin Liu, Hongyi Zhou|arXiv (Cornell University)|2020. 10. 15.
Reinforcement Learning in Robotics참고 문헌 13인용 수 8
한 줄 요약

이 논문은 동적 모델을 모델링하고 위반 신호에서 제약 조건을 추론하기 위해 불확실성 인식 신경망 앙상블을 사용하는 안전한 모델 기반 강화 학습 방법을 제안한다. 모델 예측 제어 프레임워크 내에서 모델 불확실성 하에 제어 시퀀스를 최적화하기 위해 강건한 교차 엔트로피 방법을 적용하여, Safety Gym 환경에서 기준 방법에 비해 뛰어난 제약 조건 준수 성능과 샘플 효율성을 달성한다.

ABSTRACT

This paper studies the safe reinforcement learning (RL) problem without assumptions about prior knowledge of the system dynamics and the constraint function. We employ an uncertainty-aware neural network ensemble model to learn the dynamics, and we infer the unknown constraint function through indicator constraint violation signals. We use model predictive control (MPC) as the basic control framework and propose the robust cross-entropy method (RCE) to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach achieves better constraint satisfaction than baseline safe RL methods while maintaining good task performance. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared to constrained model-free RL approaches. The code is available at this https URL.

연구 동기 및 목표

  • 시스템 동역학이나 제약 함수에 대한 사전 지식 없이 안전한 강화 학습을 해결하기 위해.
  • 모델 불확실성과 안전 제약 조건을 동시에 다룰 수 있는 모델 기반 RL 프레임워크를 개발하기 위해.
  • 제약 조건이 있는 모델 자유형 RL 접근법에 비해 샘플 효율성을 향상시키기 위해.
  • 연속 제어 환경에서 이진 위반 신호만을 사용하여 높은 수준의 제약 조건 준수를 보장하기 위해.

제안 방법

  • 불확실성 정량화 기능을 갖춘 신경망 앙상블을 사용하여 시스템 동역학을 학습한다.
  • 제약 위반의 이진 지표 신호로부터 알려지지 않은 제약 함수를 추론한다.
  • 순차적 의사결정을 위한 제어 프레임워크로 모델 예측 제어(MPC)를 적용한다.
  • 모델 불확실성과 안전 제약 조건 하에서 제어 시퀀스를 최적화하기 위해 강건한 교차 엔트로피 방법(RCE)을 도입한다.
  • 불확실성 추정을 활용하여 안전 제약 조건을 준수하면서도 강건하게 제어 동작을 탐색한다.
  • 불확실성 인식 동역학 모델링과 제약 조건 추론을 결합하여 안전한 탐색과 제어를 이끈다.

실험 결과

연구 질문

  • RQ1모델 기반 강화 학습 접근법이 시스템 동역학이나 제약 함수에 대한 사전 지식 없이 안전한 제어를 달성할 수 있는가?
  • RQ2이진 위반 신호만으로 제약 함수를 얼마나 효과적으로 추론할 수 있는가?
  • RQ3불확실성 인식 모델링이 안전 강화 학습에서 제약 조건 준수 성능을 얼마나 향상시키는가?
  • RQ4제안된 RCE 기반 MPC는 제약 조건이 있는 모델 자유형 RL 기준에 비해 샘플 효율성에서 얼마나 뛰어나게 성능을 내는가?
  • RQ5모델 불확실성 하에서의 강건 최적화가 더 나은 안전성과 성능의 상호 보완적 조합을 이끌 수 있는가?

주요 결과

  • 제안된 방법은 Safety Gym 벤치마크에서 기준 안전 RL 방법에 비해 유의미하게 뛰어난 제약 조건 준수 성능을 달성한다.
  • 시스템 동역학이나 제약 조건에 대한 사전 지식이 없더라도 강력한 작업 성능을 유지하면서 안전성을 보장한다.
  • 제약 조건이 있는 모델 자유형 RL 기준에 비해 샘플 효율성이 수 개의 주요 자리수만큼 향상된다.
  • 불확실성 인식 앙상블 모델의 사용이 제어 최적화 과정에서 모델 정확도 부족에 대한 강건성을 향상시킨다.
  • 강건한 교차 엔트로피 방법은 모델 불확실성 하에서 탐색과 안전성의 균형을 효과적으로 유지한다.
  • 이진 신호만으로도 복잡한 환경에서 안전 정책 학습을 이끄는 데 충분한 제약 조건 추론이 가능함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.