Skip to main content
QUICK REVIEW

[논문 리뷰] Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators

Zaiwei Chen, Siva Theja Maguluri|arXiv (Cornell University)|2021. 06. 24.
Reinforcement Learning in Robotics참고 문헌 37인용 수 4
한 줄 요약

이 논문은 일반화된 벨만 연산자를 사용한 오프-폴리시 TD 학습에 대한 최초의 유한 표본 분석을 제공하며, 모든 p ∈ [1, ∞)에 대해 가중 ℓp-노름 하에서 수축 성질을 갖는다. 이 프레임워크는 Qπ(λ), Tree-Backup(λ), Retrace(λ)에 대한 최초의 유한 표본 경계를 도출하고, Q-trace에 대한 기존 경계를 향상시켜 알고리즘 간의 명시적 편향-분산 트레이드오프를 드러낸다.

ABSTRACT

In temporal difference (TD) learning, off-policy sampling is known to be more practical than on-policy sampling, and by decoupling learning from data collection, it enables data reuse. It is known that policy evaluation (including multi-step off-policy importance sampling) has the interpretation of solving a generalized Bellman equation. In this paper, we derive finite-sample bounds for any general off-policy TD-like stochastic approximation algorithm that solves for the fixed-point of this generalized Bellman operator. Our key step is to show that the generalized Bellman operator is simultaneously a contraction mapping with respect to a weighted $\ell_p$-norm for each $p$ in $[1,\infty)$, with a common contraction factor. Off-policy TD-learning is known to suffer from high variance due to the product of importance sampling ratios. A number of algorithms (e.g. $Q^π(λ)$, Tree-Backup$(λ)$, Retrace$(λ)$, and $Q$-trace) have been proposed in the literature to address this issue. Our results immediately imply finite-sample bounds of these algorithms. In particular, we provide first-known finite-sample guarantees for $Q^π(λ)$, Tree-Backup$(λ)$, and Retrace$(λ)$, and improve the best known bounds of $Q$-trace in [19]. Moreover, we show the bias-variance trade-offs in each of these algorithms.

연구 동기 및 목표

  • 일반화된 벨만 방정식을 해결하는 일반적인 오프-폴리시 TD 학습 알고리즘의 유한 표본 수렴 보장을 확립하기 위해.
  • 중요도 샘플링 비율로 인해 발생하는 오프-폴리시 TD 학습의 높은 분산 문제를 다루기 위해.
  • Qπ(λ), Tree-Backup(λ), Retrace(λ), Q-trace와 같은 기존 알고리즘들을 하나의 이론적 프레임워크로 통합하고 분석하기 위해.
  • 각 알고리즘의 편향-분산 트레이드오프를 명시적 표본 복잡도 경계를 통해 드러내기 위해.

제안 방법

  • 오프-폴리시 TD 학습을 일반화된 벨만 연산자의 고정점을 목표로 하는 마코프 성질의 확률적 근사 알고리즘으로 모델링하기 위해.
  • H가 타겟 연산자이고 T가 수축 성질을 제어하는 연산자일 때, 일반화된 벨만 연산자 B(Q) = T(H(Q) - Q) + Q를 정의하기 위해.
  • 모든 p ∈ [1, ∞)에 대해 가중 ℓp-노름 하에서 일반화된 벨만 연산자가 수축 사상임을 증명하기 위해.
  • 모든 ℓp-노름에서 일관된 수축 인자로 인해, 정확도 ε에 대해 Õ(ε⁻²) 비례하는 날카운 유한 표본 경계를 유도하기 위해.
  • 존재성을 보장하고 노름 수축 분석을 가능하게 하기 위해, 엄격히 양수인 원소를 갖는 지배적 확률적 행렬 M''를 구성하기 위해.
  • 결과를 적용하여 Qπ(λ), Tree-Backup(λ), Retrace(λ), Q-trace의 표본 복잡도 경계를 도출하고, 이전 작업을 향상시키기 위해.

실험 결과

연구 질문

  • RQ1일반화된 오프-폴리시 TD 학습 알고리즘의 유한 표본 수렴을 분석할 수 있는 통합된 이론적 프레임워크를 개발할 수 있는가?
  • RQ2모든 p ∈ [1, ∞)에 대해 가중 ℓp-노름 하에서 일반화된 벨만 연산자가 수축 성질을 갖기 위한 조건는 무엇인가?
  • RQ3Qπ(λ), Tree-Backup(λ), Retrace(λ)와 같은 오프-폴리시 알고리즘의 편향과 분산은 표본 복잡도 측면에서 어떻게 트레이드오프되는가?
  • RQ4Q-trace에 대해 이전 작업보다 더 날카운 유한 표본 경계를 확립할 수 있는가, 특히 상태-행동 공간 의존성 측면에서?
  • RQ5일반화된 중요도 샘플링 비율은 오프-폴리시 TD 학습의 수렴 속도에 어떤 역할을 하는가?

주요 결과

  • 일반화된 벨만 연산자는 모든 p ∈ [1, ∞)에 대해 가중 ℓp-노름 하에서 수축 성질을 가지며, p에 관계없이 일관된 수축 인자를 갖는다. 이는 날카운 유한 표본 분석을 가능하게 한다.
  • 제안된 프레임워크는 Qπ(λ), Tree-Backup(λ), Retrace(λ)에 대한 최초의 유한 표본 경계를 도출하여 문헌의 빈도를 메운다.
  • Q-trace의 경우, 이전 최고 성능 결과 [19] 대비 적어도 |S||A| 배 향상된 표본 복잡도를 확보하여 상태-행동 공간 크기 의존도를 감소시킨다.
  • 유한 표본 경계는 각 알고리즘 내재된 편향-분산 트레이드오프를 명시적으로 드러내며, 분산 감소는 편향 증가를 수반한다.
  • 수축 성질은 전이 행렬을 지배하는 엄격히 양수인 확률적 행렬 M''의 구성에 의해 확립되며, 이는 고유한 양수 정적 분포의 존재를 보장한다.
  • 표본 복잡도는 목표 정확도 ε에 대해 Õ(ε⁻²) 비례하며, 일반화된 중요도 샘플링 비율을 포함한 문제에 따라 달라지는 요소를 수반한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.