Skip to main content
QUICK REVIEW

[논문 리뷰] Learning-Based Mean-Payoff Optimization in an Unknown MDP under Omega-Regular Constraints

Jan Křetínský, Guillermo A. Pérez|arXiv (Cornell University)|2018. 04. 24.
Reinforcement Learning in Robotics인용 수 13
한 줄 요약

이 논문은 전이 확률과 보상이 알려지지 않은 마코프 결정 과정(MDP)에서 평균-보상 보상 최적화를 위한 학습 기반 접근법을 제안하며, 오메가-규칙적 파리티 목표의 거의확실 또는 확실한 이행을 보장한다. 알려진 전이 지원과 최소 전이 확률의 하한이 있을 때, 유한 기억 및 무한 기억 온라인 학습 전략을 제안하여 높은 확률(1-γ)로 ε-최적의 평균-보상을 달성한다. 이는 부분적으로 지정된 환경에서 안전성과 적응성을 보장한다.

ABSTRACT

We formalize the problem of maximizing the mean-payoff value with high probability while satisfying a parity objective in a Markov decision process (MDP) with unknown probabilistic transition function and unknown reward function. Assuming the support of the unknown transition function and a lower bound on the minimal transition probability are known in advance, we show that in MDPs consisting of a single end component, two combinations of guarantees on the parity and mean-payoff objectives can be achieved depending on how much memory one is willing to use. (i) For all $\\epsilon$ and $\\gamma$ we can construct an online-learning finite-memory strategy that almost-surely satisfies the parity objective and which achieves an $\\epsilon$-optimal mean payoff with probability at least $1 - \\gamma$. (ii) Alternatively, for all $\\epsilon$ and $\\gamma$ there exists an online-learning infinite-memory strategy that satisfies the parity objective surely and which achieves an $\\epsilon$-optimal mean payoff with probability at least $1 - \\gamma$. We extend the above results to MDPs consisting of more than one end component in a natural way. Finally, we show that the aforementioned guarantees are tight, i.e. there are MDPs for which stronger combinations of the guarantees cannot be ensured.

연구 동기 및 목표

  • 전이 확률과 보상이 알려지지 않은 MDP에서 장기 평균 보상(평균-보상)을 최대화하는 문제를 다루는 것.
  • 전이의 지원이 알려져 있고 최소 전이 확률(π_min)에 하한이 있을 때의 부분 지식 하에 작동하는 학습 전략을 개발하는 것.
  • 평균-보상 최적성에 대해 확률적 보장을 제공하면서도 거의확실 또는 확실한 파리티 목표 이행을 보장하는 것.
  • 단일 종결성 구성요소(EC)에서의 결과를 다수의 EC를 가진 MDP로 확장하여 안전성과 성능 보장을 유지하는 것.
  • 제안된 보장이 타당한지, 즉 일반적으로 더 강력한 조합은 달성할 수 없다는 것을 보여주는 것.

제안 방법

  • 탐색을 통해 미지의 전이 확률과 보상 함수를 온라인 학습으로 추정하여, 고도의 확률(1-γ/2)로 ε/4 정확도의 근사치를 얻는다.
  • 전이 및 보상 추정치의 통계 분석을 통해 높은 평균-보상을 달성할 수 있는 양호한 종결성 구성요소(GEC)를 식별한다.
  • 먼저 MDP를 추정하기 위해 탐색을 수행한 후, 최대 기대 평균-보상을 가지는 GEC를 위한 전략으로 전환하는 유한 기억 전략을 구성한다.
  • 무한 기억 전략의 경우, 학습 후 MDP의 전체 구조를 알고 있으므로 파리티 목표를 확실하게 이행하면서 평균-보상 최적화를 보장할 수 있다.
  • 통계 농도 경계(예: 호프딩 부등식)를 적용하여 전이 및 보상 함수 추정치에 대한 신뢰도를 확보한다.
  • 거의확실한 파리티 이행 하에서 달성 가능한 최고의 평균-보상을 정의하기 위해 기준값 $\mathbf{asVal}(Q,\alpha_T)$를 사용하여 ε-최적성 보장을 가능하게 한다.

실험 결과

연구 질문

  • RQ1알려진 전이 지원과 π_min가 있을 때, 알려지지 않은 MDP에서 거의확실한 파리티 목표 이행을 보장하면서도 확률 1-γ 이상으로 ε-최적의 평균-보상을 달성할 수 있는 전략을 학습할 수 있는가?
  • RQ2무한 기억을 사용하여 파리티 목표의 확실한 이행을 달성하면서도 높은 확률로 ε-최적의 평균-보상을 확보할 수 있는가?
  • RQ3단일 종결성 구성요소에서의 유한 기억 학습 전략을 다수의 종결성 구성요소를 가진 MDP로 확장할 수 있는가? 이 경우 안전성과 성능 보장을 유지할 수 있는가?
  • RQ4부분 정보 하에서 알려지지 않은 MDP에서 안전성(파리티)과 성능(평균-보상) 보장을 결합하는 데 있어 근본적인 한계는 무엇인가?
  • RQ5제안된 보장이 타당한지, 즉 일반적으로 더 강력한 조합의 확률적 및 거의확실/확실 보장 조합은 달성할 수 없다는 것을 보일 수 있는가?

주요 결과

  • 모든 ε, γ ∈ (0,1)에 대해, 거의확실한 파리티 목표 이행과 함께 확률 1-γ 이상으로 ε-최적의 평균-보상을 달성할 수 있는 유한 기억 전략이 존재한다.
  • 모든 ε, γ ∈ (0,1)에 대해, 확실한 파리티 목표 이행과 함께 확률 1-γ 이상으로 ε-최적의 평균-보상을 달성할 수 있는 무한 기억 전략이 존재한다.
  • 다수의 종결성 구성요소를 가진 MDP로 결과를 확장할 수 있으며, 파리티 승리 전략과 GEC 최적화 전략을 조합함으로써 각 약한 양호한 MEC에서 보장을 유지한다.
  • 제안된 보장은 타당하다: 더 강력한 안전성과 성능 보장 조합을 달성할 수 없는 MDP가 존재한다.
  • 유한 기억으로도 거의확실한 파리티 목표 이행이 가능하며, 이 경우 무한 기억은 안전성 보장에 더 이상 기여하지 않는다.
  • 기준값 $\mathbf{asVal}(Q,\alpha_T)$는 거의확실한 파리티 이행 하에서 달성 가능한 최고의 평균-보상 기준을 제공하여 공식적인 ε-최적성 분석을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.