Skip to main content
QUICK REVIEW

[논문 리뷰] Non-Stationary Markov Decision Processes, a Worst-Case Approach using Model-Based Reinforcement Learning, Extended version

Erwan Lecarpentier, Emmanuel Rachelson|arXiv (Cornell University)|2019. 04. 22.
Reinforcement Learning in Robotics참고 문헌 31인용 수 4
한 줄 요약

이 논문은 리스크 회피적 트리 탐색(RATS)을 제안하며, 리프시츠 연속적인 시간에 따라 변화하는 동역학을 갖는 비정상적인 마르코프 결정 과정(NSMDP)을 위한 모델 기반 강화학습 알고리즘이다. RATS는 환경 변화를 적대적 요소로 간주하여 최악의 모델 진화 상황에서 계획을 수립함으로써 모든 가능한 진화 상황에서 안정적인 성능을 보장하고 최악의 상황에서도 수익을 최대화한다. 이는 환경의 이동 정도가 다양하게 설정된 격자 세계 기준 테스트에서 경험적으로 검증되었다.

ABSTRACT

This work tackles the problem of robust zero-shot planning in non-stationary stochastic environments. We study Markov Decision Processes (MDPs) evolving over time and consider Model-Based Reinforcement Learning algorithms in this setting. We make two hypotheses: 1) the environment evolves continuously with a bounded evolution rate; 2) a current model is known at each decision epoch but not its evolution. Our contribution can be presented in four points. 1) we define a specific class of MDPs that we call Non-Stationary MDPs (NSMDPs). We introduce the notion of regular evolution by making an hypothesis of Lipschitz-Continuity on the transition and reward functions w.r.t. time; 2) we consider a planning agent using the current model of the environment but unaware of its future evolution. This leads us to consider a worst-case method where the environment is seen as an adversarial agent; 3) following this approach, we propose the Risk-Averse Tree-Search (RATS) algorithm, a zero-shot Model-Based method similar to Minimax search; 4) we illustrate the benefits brought by RATS empirically and compare its performance with reference Model-Based algorithms.

연구 동기 및 목표

  • 시간에 따라 변화하는 경계가 있는 속도로 변화하는 비정상적인 확률적 환경에서의 강건한 계획 수립 문제를 해결하기 위해.
  • 시간에 따라 변화하는 전이 및 보상 함수에 대해 리프시츠 연속성을 가정하는 비정상적인 MDP(NSMDP)의 클래스를 체계화하기 위해.
  • 현재 모델만 알고 있고 향후 진화에 대한 정보가 없을 때 모델 불확실성 하에 작동하는 계획 알고리즘을 개발하기 위해 — 향후 환경 진화를 최악의 경우로 가정함으로써.
  • 모든 가능한 향후 환경 진화 상황에서 달성 가능한 최소 수익을 최대화하는 방법을 설계하여 강건성을 확보하기 위해.
  • 제안된 방법이 표준 모델 기반 방법보다 최악의 성능 보장을 더 잘 달성하는지 경험적으로 검증하기 위해.

제안 방법

  • 시간에 따라 변화하는 전이 및 보상 함수를 갖는 시간 의존적 MDP로 비정상적인 MDP(NSMDP)를 정의하며, 전이 및 보상 함수에 대해 시간에 대해 리프시츠 연속성을 가정한다.
  • 환경을 최악의 상황에서 수익을 최소화하도록 행동하는 적대적 에이전트로 간주하여 최악의 경우 계획을 수립하는 접근 방식을 제안한다.
  • 리스크 회피적 트리 탐색(RATS) 알고리즘을 제안하며, 최악의 상황을 가정한 미래 모델 진화의 트리에 대해 최소화 스타일의 탐색을 수행한다.
  • 최악의 향후 모델을 근사하기 위해 검색 깊이 파라미터 $d_{\text{max}}$를 사용하며, 리프 노드는 종료 상태를 나타낸다.
  • RATS를 적용하여 모든 가능한 진화 상황에서 수익의 하한을 최대화하는 정책을 계산함으로써 강건성을 확보한다.
  • 환경 이동 정도를 파라미터 $\epsilon$로 제어한 격자 세계 환경에서 RATS를 기준 모델 기반 알고리즘(DP-snapshot, DP-NSMDP)과 비교한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화학습 에이전트가 현재 모델만 알고 있고 향후 진화에 대한 정보가 없을 때 비정상적인 환경에서 강건한 성능을 달성할 수 있는가?
  • RQ2리프시츠 연속성 제약 조건 하에서 시간에 따라 변화하는 동역학을 갖는 NSMDP에서 최악의 경우 계획을 어떻게 체계화할 수 있는가?
  • RQ3적대적 환경 진화를 가정하는 최소화 스타일의 계획 접근 방식이 기대 수익 최대화 방식보다 더 나은 최악의 성능 보장을 제공하는가?
  • RQ4기존의 모델 기반 계획자에 비해 제안된 방법은 환경 이동에 대해 얼마나 덜 민감한가?
  • RQ5제한된 모델 진화 조건 하에서 유한 깊이의 트리 탐색을 통해 최악의 수익을 효과적으로 근사할 수 있는가?

주요 결과

  • RATS는 환경 이동 방향을 제어하는 $\epsilon$의 모든 값에서 일관되게 높은 성능을 보이며, 모델 진화에 대한 강건성을 입증한다.
  • DP-snapshot은 $\epsilon=0$일 때(유리한 이동)는 잘 작동하지만 $\epsilon=1$일 때는 치명적인 실패를 겪으며, 이는 그 강건성이 떨어짐을 시사한다.
  • RATS의 수익 분포는 기준 방법에 비해 상당히 낮은 왼쪽 尾(왼쪽 꼬리)를 보이며, 낮은 수익을 얻을 위험이 낮음을 나타낸다.
  • RATS는 5% 조건부가치의 위험(CVaR)에서 가장 높은 성능을 기록하며, 기대 수익 최대화를 목표로 하는 DP-snapshot 및 DP-NSMDP를 모두 능가한다.
  • RATS는 모든 가능한 진화 상황에서 최악의 수익을 최대화하여, 최소 달성 가능한 결과를 최적화하는 데 성공했음을 확인한다.
  • 경험적 결과는 RATS가 환경이 적대적으로 진화하는 상황에서도 강력한 성능을 유지함으로써 최악의 경우 계획 접근 방식이 올바르게 검증됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.