Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained Risk-Averse Markov Decision Processes

Mohamadreza Ahmadi, Ugo Rosolia|arXiv (Cornell University)|2020. 12. 04.
Bayesian Modeling and Causal Inference인용 수 6
한 줄 요약

이 논문은 CVaR 및 EVaR와 같은 동적 일관된 위험 목표를 갖는 제약 조건이 있는 마르코프 결정 과정(MDP)에 대해 마르코프 정 polit을 합성하기 위한 라그랑주 최적화 프레임워크를 제안한다. 이 방법은 위험 회피 문제를 차등 볼록 프로그래밍(DCP)으로 포지셔닝하여 체계적인 볼록-오목 프로그래밍(DCCP)을 통해 해결 가능하게 하고, 기대 비용 최소화에 비해 불확실성 하에서의 로버 탐색에서 뛰어난 강건성을 보여준다.

ABSTRACT

We consider the problem of designing policies for Markov decision processes (MDPs) with dynamic coherent risk objectives and constraints. We begin by formulating the problem in a Lagrangian framework. Under the assumption that the risk objectives and constraints can be represented by a Markov risk transition mapping, we propose an optimization-based method to synthesize Markovian policies that lower-bound the constrained risk-averse problem. We demonstrate that the formulated optimization problems are in the form of difference convex programs (DCPs) and can be solved by the disciplined convex-concave programming (DCCP) framework. We show that these results generalize linear programs for constrained MDPs with total discounted expected costs and constraints. Finally, we illustrate the effectiveness of the proposed method with numerical experiments on a rover navigation problem involving conditional-value-at-risk (CVaR) and entropic-value-at-risk (EVaR) coherent risk measures.

연구 동기 및 목표

  • 연료 또는 통신 제약과 같은 시스템 제약 조건 하에서 위험 회피 정 polit을 설계하는 데 도전하는 것.
  • 총 기대 비용을 초월하여 CVaR 및 EVaR와 같은 일반적인 일관된 위험 측정으로 제약 조건이 있는 MDP를 확장하는 것.
  • 진정한 제약 조건이 있는 위험 회피 문제의 하한을 갖는 부분 최적 정 정치를 합성하기 위한 계산적으로 실현 가능한 방법을 개발하는 것.
  • 불확실성 하에서 실제 로봇 경로 계획에 프레임워크의 효과성을 입증하는 것.
  • 제약 조건이 있는 MDP에 대한 선형 프로그래밍 접근법을 위험 회피 설정으로 일반화하는 것.

제안 방법

  • 제약 조건과 위험 목표를 함께 처리하기 위해 라그랑주 이중 프레임워크 내에서 제약 조건이 있는 위험 회피 MDP 문제를 수식화한다.
  • 위험 목표와 제약 조건을 마르코프 위험 전이 매핑을 사용하여 표현함으로써 동적이고 시간 일관된 위험 평가를 가능하게 한다.
  • 최적화 문제를 차등 볼록 프로그래밍(DCP)으로 재구성하여 체계적인 볼록-오목 프로그래밍(DCCP)을 통해 해결할 수 있도록 한다.
  • DCCP 프레임워크를 사용하여 DCP를 반복적으로 해결함으로써 비볼록 문제의 정류점으로 수렴함을 보장한다.
  • CVaR 및 EVaR 위험 측정에 모두 이 방법을 적용함으로써, 위험 민감한 의사결정에서 널리 사용되는 일관된 측정을 다룰 수 있다.
  • 해결된 최적화 문제를 사전에 오프라인으로 해결하여 실시간 로봇 계획에 적용 가능한 정 정치를 생성한다.

실험 결과

연구 질문

  • RQ1일반적인 일관된 위험 측정(총 기대 비용을 초월)에 대해 제약 조건이 있는 MDP에 대해 통합 최적화 프레임워크를 개발할 수 있는가?
  • RQ2시간 일관성과 동적 프로그래밍 구조를 유지하면서 위험 회피 목표와 시스템 제약 조건을 함께 최적화할 수 있는가?
  • RQ3DCP 공식화를 사용하여 위험 회피 제약 조건이 있는 MDP를 해결할 때의 계산 복잡도와 확장성은 어떻게 되는가?
  • RQ4다양한 일관된 위험 측정, 즉 CVaR와 EVaR는 불확실한 환경에서 강건성과 성능 측면에서 어떻게 비교되는가?
  • RQ5제안된 방법이 실제 로봇 경로 계획에서 기대 비용 최소화에 비해 불확실성 하에서 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 제안된 방법은 제약 조건이 있는 위험 회피 MDP를 DCP로 성공적으로 포지셔닝하여 DCCP 프레임워크를 통해 해결 가능하게 했다.
  • $20 \times 20$ 격자 세계에서 EVaR 기반 정 정치는 100회의 몬테카를로 시뮬레이션 동안 실패율 2%를 기록했으며, CVaR(5%) 및 총 기대값(18%)에 비해 뛰어난 성능을 보였다.
  • EVaR 정 정치는 더 작은 격자($10 \times 10$ 및 $15 \times 15$)에서 0%의 실패율을 기록하여 그 보수적인 성향과 일관되게 가장 높은 강건성을 보였다.
  • CVaR 공식화는 EVaR에 비해 훨씬 더 많은 계산 시간(20×20에서 10.5초)을 요구했으며, 이는 이전의 계산 효율성에 대한 발견을 확인했다.
  • 위험 회피 목표의 값은 이론적 순서 $\mathbb{E}(c) \leq \mathrm{CVaR}_{\varepsilon}(c) \leq \mathrm{EVaR}_{\varepsilon}(c)$를 따르며, 계산된 상태 값으로 확인되었다.
  • EVaR 및 CVaR에서 유도된 정 정치는 특히 높은 불확실성 영역에서 기대 비용 정 정치보다 더 강하게 불확실한 장애물을 회피하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.