Skip to main content
QUICK REVIEW

[논문 리뷰] Weak Convergence Properties of Constrained Emphatic Temporal-difference Learning with Constant and Slowly Diminishing Stepsize

Huizhen Yu|arXiv (Cornell University)|2015. 11. 23.
Reinforcement Learning in Robotics참고 문헌 36인용 수 12
한 줄 요약

이 논문은 오프-폴리시 강화학습에서 상수 및 점차 감소하는 스텝사이즈를 사용할 때 제약 조건이 부여된 강한 시간차분 학습(ETD(λ)))의 약한 수렴 성질을 수립한다. 일반적인 오프-폴리시 조건 하에서 최적의 가치 함수 근방으로의 점근적 수렴을 증명하며, 약한 Feller 마코프 체인 이론과 확률적 근사법을 활용하고, 고정된 상수 스텝사이즈에 대한 편차의 경계도 제시한다.

ABSTRACT

We consider the emphatic temporal-difference (TD) algorithm, ETD($λ$), for learning the value functions of stationary policies in a discounted, finite state and action Markov decision process. The ETD($λ$) algorithm was recently proposed by Sutton, Mahmood, and White to solve a long-standing divergence problem of the standard TD algorithm when it is applied to off-policy training, where data from an exploratory policy are used to evaluate other policies of interest. The almost sure convergence of ETD($λ$) has been proved in our recent work under general off-policy training conditions, but for a narrow range of diminishing stepsize. In this paper we present convergence results for constrained versions of ETD($λ$) with constant stepsize and with diminishing stepsize from a broad range. Our results characterize the asymptotic behavior of the trajectory of iterates produced by those algorithms, and are derived by combining key properties of ETD($λ$) with powerful convergence theorems from the weak convergence methods in stochastic approximation theory. For the case of constant stepsize, in addition to analyzing the behavior of the algorithms in the limit as the stepsize parameter approaches zero, we also analyze their behavior for a fixed stepsize and bound the deviations of their averaged iterates from the desired solution. These results are obtained by exploiting the weak Feller property of the Markov chains associated with the algorithms, and by using ergodic theorems for weak Feller Markov chains, in conjunction with the convergence results we get from the weak convergence methods. Besides ETD($λ$), our analysis also applies to the off-policy TD($λ$) algorithm, when the divergence issue is avoided by setting $λ$ sufficiently large.

연구 동기 및 목표

  • 표준 TD(λ)가 행동 정책와 목표 정책가 다를 때 발생하는 오랜 기간 지속되는 발산 문제를 해결하기 위해.
  • 상수 및 점차 감소하는 스텝사이즈 스케줄 하에서 제약 조건이 부여된 ETD(λ)의 수렴 보장을 수립하기 위해.
  • 확률적 근사 이론의 약한 수렴 방법을 사용하여 ETD(λ) 반복의 점근적 행동을 특성화하기 위해.
  • λ가 충분히 크면 오프-폴리시 TD(λ)로 이러한 결과를 확장하여 제약 조건이 부여된 버전의 새로운 수렴 성질을 제공하기 위해.
  • 유한 샘플 행동과 상수 스텝사이즈 설정에서의 편차 경계를 분석하여 실용적 안정성과 해석 가능성 향상시키기 위해.

제안 방법

  • 확률적 근사 이론에서 유도된 약한 수렴 방법을 사용하여 제약 조건이 부여된 ETD(λ) 반복의 극한 행동을 분석한다.
  • 학습 동역학에 의해 유도된 마코프 체인의 약한 Feller 성질을 활용하여 에르고딕성과 안정성을 확보한다.
  • 평균 상수 미분방정식(ODE)을 유도하여 평균화된 반복의 극한 행동을 기술한다.
  • 오프-폴리시 환경에서 학습을 안정화하고 분산을 줄이기 위해 편향 항을 포함한 제약 조건이 부여된 ETD(λ)의 두 가지 변형을 제안한다.
  • 약한 Feller 체인에 대한 에르고딕 정리를 활용하여 샘플 경로 행동을 투영된 벨만 방정식의 해와 연결한다.
  • λ가 충분히 크면 수렴 성질이 동일하므로, 오프-폴리시 TD(λ)로 결과를 확장한다.

실험 결과

연구 질문

  • RQ1상수 스텝사이즈를 사용할 때 제약 조건이 부여된 ETD(λ)가 최적의 가치 함수 근방으로 약한 수렴하는 조건은 무엇인가?
  • RQ2점차 감소하는 스텝사이즈를 사용할 때 ETD(λ)의 점근적 행동은 상수 스텝사이즈를 사용할 때와 비교해 어떻게 다른가?
  • RQ3고정된 상수 스텝사이즈 하에서 평균화된 반복의 최적 해로부터의 편차 경계는 무엇인가?
  • RQ4λ가 충분히 크면 ETD(λ)의 수렴 결과를 오프-폴리시 TD(λ)로 확장할 수 있는가?
  • RQ5기본 마코프 체인의 약한 Feller 성질이 제약 조건이 부여된 ETD(λ)의 수렴 분석에 어떻게 기여하는가?

주요 결과

  • 상수 스텝사이즈를 사용할 때 제약 조건이 부여된 ETD(λ)는 최적 해의 근방으로 약한 수렴하며, 이 편차는 스텝사이즈에 비례하는 항으로 유계이다.
  • 점차 감소하는 스텝사이즈를 사용할 경우, 일반적인 오프-폴리시 조건 하에서 알고리즘이 약한 수렴을 통해 최적의 해로 수렴한다.
  • 제약 조건이 부여된 ETD(λ)의 평균화된 과정에 대한 평균 ODE는 유일한 전역적으로 끌리는 평형점을 가지며, 이는 원하는 가치 함수로의 수렴을 보장한다.
  • λ가 충분히 크면(예: λ=1), 동일한 수렴 결과가 오프-폴리시 TD(λ)에도 적용되며, ETD(λ)를 초월한 분석을 확장한다.
  • 학습 동역학에 의해 유도된 마코프 체인의 약한 Feller 성질은 에르고딕성을 보장하며, 이는 수렴 분석에 에르고딕 정리를 적용할 수 있게 한다.
  • 이 분석은 제약 조건이 부여된 ETD(λ)와 오프-폴리시 TD(λ)에 대해 새로운 이론적 보장을 제공하며, 특히 오프-폴리시 환경에서 고분산 중요도 샘플링을 다루는 데 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.