Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained Model-based Reinforcement Learning with Robust Cross-Entropy Method

Zuxin Liu, Hongyi Zhou|arXiv (Cornell University)|2020. 10. 15.
Reinforcement Learning in Robotics참고 문헌 32인용 수 14
한 줄 요약

이 논문은 모델 불확실성과 희박한 제약 위반 신호 하에서 제약 조건이 있는 제어 시퀀스를 최적화하기 위해 강건한 크로스 엔트로피 방법(RCE)을 사용하는 제약 조건이 있는 모델 기반 강화학습 알고리즘을 제안한다. 예측 불확실성을 고려한 신경망 앙상블과 모델 예측 제어를 통합함으로써, 안전성 테스트 벤치마크에서 거의 제로에 가까운 제약 위반과 뛰어난 샘플 효율성을 달성하며, 최신의 모델리스 및 모델 기반 기준선을 능가한다.

ABSTRACT

This paper studies the constrained/safe reinforcement learning (RL) problem with sparse indicator signals for constraint violations. We propose a model-based approach to enable RL agents to effectively explore the environment with unknown system dynamics and environment constraints given a significantly small number of violation budgets. We employ the neural network ensemble model to estimate the prediction uncertainty and use model predictive control as the basic control framework. We propose the robust cross-entropy method to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach learns to complete the tasks with a much smaller number of constraint violations than state-of-the-art baselines. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared with constrained model-free RL approaches. The code is available at \url{https://github.com/liuzuxin/safe-mbrl}.

연구 동기 및 목표

  • 시스템 역학 또는 제약 함수에 대한 사전 지식이 없이도 작동하는 제약 조건이 있는 모델 기반 강화학습 알고리즘을 개발하는 것.
  • 제약 위반에 대한 희박한 지표 신호와 제한된 비안전 샘플이 존재하는 상황에서 안전한 정책을 학습하는 도전 과제를 해결하는 것.
  • 해석적 제약 식이 불가능한 고차원 관측 공간에서 샘플 효율성과 제약 조건 이행을 향상시키는 것.
  • 모델 불확실성에 강건한 최적화 방법을 설계하여 훈련 중 비안전 정책 업데이트를 방지하는 것.
  • 안전 핵심 환경에서 거의 최적의 작업 성능을 달성하면서도 제약 위반을 최소화하는 것.

제안 방법

  • 역학 모델의 예측 불확실성을 추정하기 위해 신경망 앙상블을 사용하여 불확실성 인식 계획을 가능하게 한다.
  • 유한 시간 간격 동안 제어 시퀀스를 최적화하기 위해 모델 예측 제어(MPC)를 제어 프레임워크로 활용한다.
  • 행동 시퀀스를 최적화하기 위해 안전한 엘리트 샘플만 선택하는 강건한 크로스 엔트로피(RCE) 방법을 도입함으로써, 비안전 궤적에 기인한 편향을 감소시킨다.
  • RCE는 표준 CEM과 달리 분포 업데이트 중 비안전 샘플을 기각하지만, CEM은 처벌된 비안전 엘리트 샘플을 포함하므로 안전성이 향상된다.
  • 불확실성 추정과 제약 지표 신호를 활용하여 작업 보상과 제약 이행을 동시에 최적화한다.
  • 역학 또는 제약 조건에 대한 해석적 형태를 가정하지 않는 제약 조건이 있는 마르코프 결정 과정(CMDP) 프레임워크 내에서 알고리즘이 작동한다.

실험 결과

연구 질문

  • RQ1역학과 제약 조건이 모두 알려지지 않은 상황에서 모델 기반 강화학습 접근법이 거의 제로에 가까운 제약 위반으로 높은 작업 성능을 달성할 수 있는가?
  • RQ2표준 CEM 및 모델리스 기준선과 비교해 볼 때, 강건한 크로스 엔트로피(RCE)는 안전성과 샘플 효율성을 어떻게 향상시키는가?
  • RQ3희박한 제약 피드백이 존재하는 환경에서 불확실성 인식 역학 모델은 비안전 탐색을 얼마나 줄일 수 있는가?
  • RQ4제한된 위반 예산이 존재할 때, 제안된 방법은 제약 이행과 작업 보상 측면에서 어떻게 비교되는가?
  • RQ5해석적 제약 함수가 불가능한 고차원 감각 관측에서 RCE는 성능을 유지할 수 있는가?

주요 결과

  • Point Goal 1 작업에서 MPC-RCE는 첫 10,000개의 훈련 스텝 동안 오직 16.00건의 제약 위반을 기록했으며, MPC-CEM(184.33건)과 MPC-random(169.0건)에 비해 현저히 적다.
  • Car Goal 2 작업에서는 MPC-RCE가 96.00건의 위반을 기록했고, MPC-CEM(578.00건)과 MPC-random(509.33건)에 비해 뛰어난 안전성을 보였다.
  • 제약 조건이 있는 모델리스 강화학습 접근법에 비해 샘플 효율성이 수 개의 지수 차수만큼 뛰어나, 훨씬 더 많은 비안전 샘플이 필요로 하는 것을 확인했다.
  • RCE는 CEM의 샘플 분포에 기인한 편향을 피함으로써 CEM을 능가했다: CEM은 처벌된 비안전 엘리트 샘플을 포함하기 때문에 후속 반복에서 비안전 행동이 증가했다.
  • 덜 안전한 방법들과 비교해 유사한 작업 보상을 유지하면서도 제약 위반 수를 크게 줄였기 때문에, 안전 핵심 환경에 적합한 배포가 가능하다.
  • 결과적으로 RCE는 제한된 위반 예산 하에서 표준 CEM 및 모델리스 방법보다 제약 위반을 최소화하는 데 더 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.