Skip to main content
QUICK REVIEW

[논문 리뷰] On the Use of Non-Stationary Policies for Stationary Infinite-Horizon Markov Decision Processes

Bruno Scherrer, Boris Lesner|arXiv (Cornell University)|2012. 11. 29.
Reinforcement Learning in Robotics참고 문헌 28인용 수 15
한 줄 요약

이 논문은 유한할 수 없는 할인 무한 시간 마코프 결정 과정에 대해 비정적 정책을 생성하는 근사 가치 반복(AVI) 및 정책 반복(API)의 새로운 변형을 제안하며, 성능 한계로 $\frac{2\gamma}{1-\gamma}\epsilon$를 달성한다. 이는 정적 정책에 대한 표준 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 한계보다 $\frac{1}{1-\gamma}$ 배 더 우수하다. 핵심 통찰은 $\gamma$가 1에 가까울 때 근사 최적의 비정적 정책을 계산하는 것이 근사 최적의 정적 정책을 계산하는 것보다 훨씬 간단하다는 것이다.

ABSTRACT

We consider infinite-horizon stationary $γ$-discounted Markov Decision Processes, for which it is known that there exists a stationary optimal policy. Using Value and Policy Iteration with some error $ε$ at each iteration, it is well-known that one can compute stationary policies that are $\frac{2γ}{(1-γ)^2}ε$-optimal. After arguing that this guarantee is tight, we develop variations of Value and Policy Iteration for computing non-stationary policies that can be up to $\frac{2γ}{1-γ}ε$-optimal, which constitutes a significant improvement in the usual situation when $γ$ is close to 1. Surprisingly, this shows that the problem of "computing near-optimal non-stationary policies" is much simpler than that of "computing near-optimal stationary policies".

연구 동기 및 목표

  • 오차가 $\epsilon$로 유계일 때, 기존 AVI 및 API 알고리즘이 정적 정책을 생성하고, 이로 인해 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$의 하위 최적 성능 한계를 가지는 제한점을 해결하기 위해.
  • 동일한 오차 가정 하에 비정적 정책이 정적 정책보다 훨씬 더 나은 성능 보장을 달성할 수 있는지 조사하기 위해.
  • 개선된 이론적 성능 한계를 가진 주기적인 비정적 정책을 생성하는 새로운 AVI 및 API 변형을 개발하기 위해.
  • 근사 오차가 존재하는 상황에서 근사 최적의 비정적 정책을 계산하는 문제는 근사 최적의 정적 정책을 계산하는 문제보다 본질적으로 더 단순하다는 것을 보여주기 위해.

제안 방법

  • 오차 $\epsilon_k$ 가 유계인 값 함수의 수열을 생성하고, 최종 정책 수열에서 비정적 정책을 도출하는 수정된 AVI 알고리즘을 제안한다.
  • 유한한 정적 정책 수열을 순환하여 주기적인 비정적 정책을 생성하는 두 가지 새로운 정책 반복 변형을 도입한다.
  • 반복 수열에서 생성된 마지막 $m$개의 정책을 주기 $m$으로 순환하는 주기적 비정적 정책 $\pi_{k,m}$를 정의한다.
  • 벨만 연산자와 오차 전파를 활용하여, $T_{\pi_*}$의 수축 성질을 이용해 $\|v_* - v_{\pi_{k,m}}\|_\infty$에 대한 재귀적 오차 한계를 수립한다.
  • 비정적 정책에 대한 성능 한계 $\frac{2\gamma}{(1-\gamma^m)(1-\gamma)}\epsilon$를 유도하며, $m \to \infty$일 때 $\frac{2\gamma}{1-\gamma}\epsilon$로 수렴한다.
  • 성분별 분석과 수학적 귀납법을 사용하여 오차 한계를 증명하며, $\gamma$가 1에 가까울 때 기존의 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 한계보다 엄밀히 더 날카로운 새로운 한계임을 보여준다.

실험 결과

연구 질문

  • RQ1무한 시간 MDP의 근사 AVI 및 API에서 비정적 정책이 정적 정책보다 더 나은 성능 한계를 달성할 수 있는가?
  • RQ2근사 오차가 존재하는 상황에서도 AVI 및 API에 대한 고전적 성능 한계 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$가 여전히 날카로운가?
  • RQ3근사 최적의 비정적 정책을 계산하는 문제는 근사 최적의 정적 정책을 계산하는 문제보다 본질적으로 더 단순한가?
  • RQ4수정된 AVI 및 API 알고리즘을 통해 생성된 비정적 정책이 달성할 수 있는 이론적 성능 한계는 무엇인가?
  • RQ5주기적 비정적 정책에서 주기 $m$의 선택은 근사 오차와 메모리 비용 사이의 트레이드오프에 어떻게 영향을 미치는가?

주요 결과

  • AVI 및 API에 대한 고전적 성능 한계 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$는 AVI에 대해서도 이전 문헌에서 공식적으로 입증되지 않았음에도 불구하고 여전히 날카로운 것으로 밝혀졌다.
  • 비정적 정책을 위한 제안된 AVI 기반 알고리즘은 $\frac{2\gamma}{(1-\gamma^m)(1-\gamma)}\epsilon$의 성능 한계를 달성하며, 이는 표준 한계보다 $\frac{1}{1-\gamma}$ 배 더 뛰어나다.
  • 주기 $m$을 가진 주기적 비정적 정책의 경우, $m \to \infty$일 때 성능 한계는 $\frac{2\gamma}{1-\gamma}\epsilon$로 수렴하며, $\gamma$가 1에 가까울수록 이는 상당히 향상된다.
  • $m = \left\lceil \frac{1}{1-\gamma} \right\rceil$로 선택할 경우, 성능 한계는 최대 $\frac{3.164\gamma}{1-\gamma}\epsilon$가 되며, 이는 점 渐진 한계의 상수 배 이내에 해당한다.
  • 새로운 한계 $\frac{2\gamma}{1-\gamma}\epsilon$는 날카로운 것으로 추측되며, 저자들은 분석을 $L_p$-노름 오차 제어로 확장할 수 있을 것이라 믿는다.
  • 결과적으로 근사 오차 모델이 동일한 조건에서 근사 최적의 비정적 정책을 계산하는 문제의 본질은 근사 최적의 정적 정책을 계산하는 문제보다 훨씬 단순하다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.