Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty

Reazul Hasan Russel, Mouhacine Benosman|arXiv (Cornell University)|2020. 10. 10.
Reinforcement Learning in Robotics참고 문헌 20인용 수 6
한 줄 요약

이 논문은 모델 불확실성 하에서 성능의 강인성과 제약 조건 이행을 동시에 보장하기 위해 제약 조건이 있는 MDP와 강인 MDP를 통합하는 새로운 프레임워크인 강인 제약 조건 MDP(ROBUST CONSTRAINED-MDPs, RCMDPs)를 제안한다. 이는 라그랑주 기반 정책 그래디언트 알고리즘을 도입하여 최악의 상황에서의 성능과 누적 제약 비용을 최적화함으로써, 전이 확률에 대한 불확실성에도 불구하고 제약 조건을 보장하는 재고 관리에서 향상된 안전성과 강인성을 입증한다.

ABSTRACT

In this paper, we focus on the problem of robustifying reinforcement learning (RL) algorithms with respect to model uncertainties. Indeed, in the framework of model-based RL, we propose to merge the theory of constrained Markov decision process (CMDP), with the theory of robust Markov decision process (RMDP), leading to a formulation of robust constrained-MDPs (RCMDP). This formulation, simple in essence, allows us to design RL algorithms that are robust in performance, and provides constraint satisfaction guarantees, with respect to uncertainties in the system's states transition probabilities. The need for RCMPDs is important for real-life applications of RL. For instance, such formulation can play an important role for policy transfer from simulation to real world (Sim2Real) in safety critical applications, which would benefit from performance and safety guarantees which are robust w.r.t model uncertainty. We first propose the general problem formulation under the concept of RCMDP, and then propose a Lagrangian formulation of the optimal problem, leading to a robust-constrained policy gradient RL algorithm. We finally validate this concept on the inventory management problem.

연구 동기 및 목표

  • 안전 중심 응용 분야에서 모델-기반 및 비모델 기반 강화 학습의 강인성 부족과 제약 조건 이행 문제를 해결하기 위해.
  • 모델 불확실성을 다루는 강인 MDP(RMDPs)와 비용 제약 조건을 통해 안전성을 보장하는 제약 조건 MDP(CMDPs) 간의 격차를 메우기 위해, 통합된 RCMDP 공식을 제안하기 위해.
  • 최악의 전이 확률 하에서도 강인한 성능과 제약 조건 이행을 보장하는 정책 그래디언트 알고리즘을 개발하기 위해.
  • 모델 불확실성과 경직된 안전 제약 조건이 존재하는 실제 재고 관리 문제에 대해 접근 방식을 검증하기 위해.

제안 방법

  • 전이 확률에 대한 모호성 집합을 사용하여, CMDP 제약 조건과 RMDP의 최악의 상황 강인성을 결합함으로써 RCMDPs를 공식화한다.
  • 최악의 모델 변형 하에서도 성능과 제약 조건 이행을 동시에 최적화하기 위해 라그랑주 이중 공식을 유도한다.
  • 빠른 업데이트를 위한 정책 파라미터 θ와 느린 업데이트를 위한 라그랑주 승수 λ를 갖는 이중 시간 척도(stochastic policy gradient) 알고리즘을 제안한다.
  • 모호성 집합 내에서 최소화를 통해 각 상태-행동 쌍에 대한 최악의 전이 확률을 계산하여 강인성을 확보한다.
  • 노미널 전이와 최악의 전이를 사용한 몬테카를로 롤아웃을 통해 정책 및 제약 목표의 그래디언트를 추정한다.
  • 표준 스토크래틱 근사 조건을 사용하며, θ와 λ 업데이트 간의 시간 척도 분리를 확보한다.

실험 결과

연구 질문

  • RQ1모델 불확실성 하에서도 강인한 성능과 제약 조건 이행을 동시에 보장할 수 있는 통합 프레임워크를 개발할 수 있는가?
  • RQ2CMDP의 라그랑주 완화가 전이 동역학의 최악의 모델 변형을 통합할 수 있도록 어떻게 확장할 수 있는가?
  • RQ3제안된 강인-제약 조건 정책 그래디언트 알고리즘이 비간접적 또는 비제약 조건 기반 기준 대비 최악의 상황에서의 성능 향상을 이루면서도 제약 조건 이행을 유지하는가?
  • RQ4이 알고리즘은 모의 환경에서의 동작이 실제 환경으로의 전이(Sim2Real)에 효과적으로 대응할 수 있는가? 특히, 모의-실제 전이 동역학의 불확실성이 존재하는 안전 중심 응용 분야에서.

주요 결과

  • 재고 관리 문제에서 강인-제약 조건 정책 그래디언트 알고리즘이 최악의 상황에서의 성능을 고려함으로써 예상 수익이 강인-비제약 조건 기반 대비 높아, 제약 조건 하에서의 성능 향상을 입증한다.
  • 비간접적 비제약 조건 기반 기준 대비 강인성과 안전성 측면에서 강인-제약 조건 접근 방식이 뛰어나지만, 최악의 상황 계획으로 인해 약간의 예상 수익 감소가 발생한다.
  • 알고리즘은 모든 에피소드 동안 제약 예산을 성실히 이행하여, 모델 불확실성 하에서도 신뢰할 수 있는 제약 조건 이행을 입증한다.
  • 비간접적 비제약 조건 기반 기준은 더 높은 예상 수익을 달성하지만 안전 보장을 하지 못함으로써, 성능와 강인성 간의 상충 관계를 드러낸다.
  • 이중 시간 척도 업데이트 체계는 표준 스토크래틱 근사 이론에 의해 지지되며, 국소 안장점에 수렴함을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.