Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators

Zaiwei Chen, Siva Theja Maguluri|arXiv (Cornell University)|Jun 24, 2021
Reinforcement Learning in Robotics参考文献 37被引用数 4
ひとこと要約

本稿は、一般化ベルマン作用素を用いたオフポリシーTD学習の最初の有限標本解析を提供し、すべてのp ∈ [1, ∞)に対して重み付きℓpノルムの下で収縮写像であることを証明している。収縮因子はpに依存しない一様なものである。この枠組みにより、Qπ(λ)、Tree-Backup(λ)、Retrace(λ)に対する最初の既知の有限標本バウンドが得られ、Q-traceについても既存のバウンドを改善し、アルゴリズム間でのバイアス-バリアンストレードオフが明示的に明らかになった。

ABSTRACT

In temporal difference (TD) learning, off-policy sampling is known to be more practical than on-policy sampling, and by decoupling learning from data collection, it enables data reuse. It is known that policy evaluation (including multi-step off-policy importance sampling) has the interpretation of solving a generalized Bellman equation. In this paper, we derive finite-sample bounds for any general off-policy TD-like stochastic approximation algorithm that solves for the fixed-point of this generalized Bellman operator. Our key step is to show that the generalized Bellman operator is simultaneously a contraction mapping with respect to a weighted $\ell_p$-norm for each $p$ in $[1,\infty)$, with a common contraction factor. Off-policy TD-learning is known to suffer from high variance due to the product of importance sampling ratios. A number of algorithms (e.g. $Q^π(λ)$, Tree-Backup$(λ)$, Retrace$(λ)$, and $Q$-trace) have been proposed in the literature to address this issue. Our results immediately imply finite-sample bounds of these algorithms. In particular, we provide first-known finite-sample guarantees for $Q^π(λ)$, Tree-Backup$(λ)$, and Retrace$(λ)$, and improve the best known bounds of $Q$-trace in [19]. Moreover, we show the bias-variance trade-offs in each of these algorithms.

研究の動機と目的

  • 一般化ベルマン方程式を解く一般オフポリシーTD学習アルゴリズムの有限標本収束保証を確立すること。
  • 重要度サンプリング比に起因するオフポリシーTD学習における高い分散問題を解決すること。
  • Qπ(λ)、Tree-Backup(λ)、Retrace(λ)、Q-traceといった複数の既存アルゴリズムを、統一的な理論的枠組みで統合・分析すること。
  • 各アルゴリズムに内在するバイアス-バリアンストレードオフを、明示的な標本複雑度バウンドを通じて明らかにすること。

提案手法

  • オフポリシーTD学習を、一般化ベルマン作用素の不動点を標的とするマルコフ連鎖の確率的近似アルゴリズムとしてモデル化する。
  • Hがターゲット作用素で、Tが収縮性を制御する要因である、一般化ベルマン作用素B(Q) = T(H(Q) - Q) + Qを定義する。
  • すべてのp ∈ [1, ∞)に対して、重み付きℓpノルムの下で一般化ベルマン作用素が収縮写像であることを証明し、pに依存しない一様な収縮因子を持つことを示す。
  • ℓpノルム全体にわたる一様収縮性を活用し、精度εに対するタイトな有限標本バウンドがÕ(ε⁻²)スケールで得られることを導出する。
  • 正の定常分布の存在を保証するため、正の要素をすべて有する支配的確率的行列M''を構築し、ノルム収縮解析を可能にする。
  • 得られた結果を応用して、Qπ(λ)、Tree-Backup(λ)、Retrace(λ)、Q-traceの標本複雑度バウンドを導出し、先行研究を改善する。

実験結果

リサーチクエスチョン

  • RQ1一般オフポリシーTD学習アルゴリズムの有限標本収束を分析する統一的理論枠組みを構築することは可能か?
  • RQ2すべてのp ∈ [1, ∞)に対して、重み付きℓpノルムの下で一般化ベルマン作用素が収縮写像であるための条件は何か?
  • RQ3Qπ(λ)、Tree-Backup(λ)、Retrace(λ)のようなオフポリシーアルゴリズムのバイアスとバリアンスは、標本複雑度の観点でどのようにトレードオフするか?
  • RQ4Q-traceについて、先行研究に比べてよりタイトな有限標本バウンドを確立できるか、特に状態-行動空間依存性の観点から?
  • RQ5一般化重要度サンプリング比は、オフポリシーTD学習の収束速度にどのように寄与するか?

主な発見

  • 一般化ベルマン作用素は、すべてのp ∈ [1, ∞)に対して重み付きℓpノルムの下で収縮写像であり、pに依存しない一様な収縮因子を持つ。これにより、タイトな有限標本解析が可能になった。
  • 提案された枠組みにより、Qπ(λ)、Tree-Backup(λ)、Retrace(λ)に対する最初の既知の有限標本バウンドが得られ、文献における空白を埋めた。
  • Q-traceに関しては、先行研究[19]の最良結果に比べ、少なくとも|S||A|の要因で標本複雑度が改善され、状態-行動空間サイズへの依存が軽減された。
  • 有限標本バウンドは、各アルゴリズムに内在するバイアス-バリアンストレードオフを明示的に明らかにし、バリアンスの低減がバイアスの増加を伴うことを示している。
  • 収縮性は、遷移行列を支配する正の要素をすべて有する確率的行列M''の構築により確立され、一意な正の定常分布の存在が保証された。
  • 標本複雑度は、εが目標精度であるとき、Õ(ε⁻²)スケールで増加する。問題依存要因には、一般化重要度サンプリング比が含まれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。