Skip to main content
QUICK REVIEW

[논문 리뷰] On the convergence of optimistic policy iteration for stochastic shortest path problem

Yuanlong Chen|arXiv (Cornell University)|2018. 08. 27.
Optimization and Search Problems참고 문헌 4인용 수 3
한 줄 요약

이 논문은 할인율 α=1인 경우를 포함한 할인 및 할인되지 않은 설정에서, 정책 평가에 몬테카를로 및 TD(λ) 방법을 사용할 때, 확률적 최단경로 문제에 대한 낙관적 정책 반복의 수렴성을 확립한다. 알고리즘은 적절한 정책 하에서 최적의 도착비용 함수로 수렴하며, 수축 원리와 값 갱신 시 오차 전파의 유계성에 의해 수렴이 보장된다.

ABSTRACT

In this paper, we prove some convergence results of a special case of optimistic policy iteration algorithm for stochastic shortest path problem. We consider both Monte Carlo and $TD(λ)$ methods for the policy evaluation step under the condition that the termination state will eventually be reached almost surely.

연구 동기 및 목표

  • 할인율 α=1인 경우에 대해 확률적 최단경로 문제에 대한 낙관적 정책 반복의 수렴성을 확립하기 위해.
  • 정책 평가에 몬테카를로 또는 TD(λ) 방법을 사용할 때, 적절한 정책 하에서 수렴 행동을 분석하기 위해.
  • 근사 정책 평가가 존재하더라도 알고리즘이 최적의 도착비용 벡터로 수렴함을 증명하기 위해.
  • 기존의 정책 반복 수렴 결과를 오차가 유계인 최적의 설정으로 확장하기 위해.

제안 방법

  • 값 평가 및 정책 평가에 각각 표준 동적 프ogramming 연산자 T 및 Tμ를 사용한다.
  • 수렴 분석을 위해 최대노름과 가중 최대노름을 사용한다.
  • 수축 원리와 수열 Yt 및 Ytl을 통한 비교 원리를 활용하여 오차 전파를 유계로 제한한다.
  • 마팅갈 유사 노이즈 항을 다루기 위해 정지과정 v^l(t)을 도입하여, 유계 분산 조건 하에서 수렴을 보장한다.
  • 유계성과 limsup(c_t) ≤ 0에 기반한 핵심 부등식 T_{μ_t}^{k+1}J_t ≤ TJ_t + ε를 유도한다. 이는 큰 t 및 k에 대해 성립한다.
  • ε가 임의로 작은 값을 가질 수 있도록 재귀적 갱신을 통해 수렴을 확립한다: J_{t+1} ≤ (1−γ_t)J_t + γ_t(TJ_t + ε) + γ_tω_t.

실험 결과

연구 질문

  • RQ1정책 평가가 몬테카를로 또는 TD(λ) 방법을 통해 근사화될 때, 낙관적 정책 반복은 수렴하는가?
  • RQ2적절한 정책 하에서 확률적 최단경로 문제의 α=1 경우에 수렴이 보장되는가?
  • RQ3정책 평가에서의 유계 오차는 값 함수의 최적 해로의 수렴에 어떤 영향을 미치는가?
  • RQ4근사 오차가 존재하더라도 값 벡터의 수열이 최적의 도착비용 벡터로 수렴하기 위한 조건는 무엇인가?
  • RQ5일반적인 정책 평가 체계를 고려할 때, 수렴 증명을 낙관적 정책 반복 프레임워크로 확장할 수 있는가?

주요 결과

  • 모든 정책이 적절하고 α=1일 때, 알고리즘이 최적의 도착비용 벡터 J*로 수렴한다.
  • 모든 ε>0에 대해, t(ε)가 존재하여 모든 t≥t(ε)에 대해 근사 정책 평가가 (1−λ)∑λ^k T_{μ_t}^{k+1}J_t ≤ TJ_t + εe를 만족한다.
  • 값 벡터의 수열 J_t는 t→∞일 때 J*로 수렴하며, 감소하는 노이즈 및 오차 항에 의해 오차 c_t의 limsup가 0으로 유 bounds된다.
  • 정지과정 v^l(t)의 사용은 오차 수열 v_t가 수렴을 방해하지 않음을 보장하며, 결과적으로 Y_t가 εe로 수렴하고 ε→0일 때 Y_t → 0이 된다.
  • 수렴 증명은 Y_t를 사용한 비교 원리에 기반하며, Y_t가 εe로 수렴함을 보여 이는 값 갱신 오차가 한계에서 소멸함을 의미한다.
  • 몬테카를로 및 TD(λ) 정책 평가 모두 성립하며, 정책 평가 오차가 유계이고 정책이 적절할 경우에 한하여 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.