Skip to main content
QUICK REVIEW

[论文解读] Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators

Zaiwei Chen, Siva Theja Maguluri|arXiv (Cornell University)|Jun 24, 2021
Reinforcement Learning in Robotics参考文献 37被引用 4
一句话总结

本文首次对使用广义贝尔曼算子的离策略TD学习进行了有限样本分析,证明了在所有p ∈ [1, ∞)的加权ℓp-范数下,该算子为压缩映射,且压缩因子一致。该框架首次为Qπ(λ)、Tree-Backup(λ)和Retrace(λ)提供了有限样本界,并改进了Q-trace的现有界,揭示了各算法间显式的偏差-方差权衡。

ABSTRACT

In temporal difference (TD) learning, off-policy sampling is known to be more practical than on-policy sampling, and by decoupling learning from data collection, it enables data reuse. It is known that policy evaluation (including multi-step off-policy importance sampling) has the interpretation of solving a generalized Bellman equation. In this paper, we derive finite-sample bounds for any general off-policy TD-like stochastic approximation algorithm that solves for the fixed-point of this generalized Bellman operator. Our key step is to show that the generalized Bellman operator is simultaneously a contraction mapping with respect to a weighted $\ell_p$-norm for each $p$ in $[1,\infty)$, with a common contraction factor. Off-policy TD-learning is known to suffer from high variance due to the product of importance sampling ratios. A number of algorithms (e.g. $Q^π(λ)$, Tree-Backup$(λ)$, Retrace$(λ)$, and $Q$-trace) have been proposed in the literature to address this issue. Our results immediately imply finite-sample bounds of these algorithms. In particular, we provide first-known finite-sample guarantees for $Q^π(λ)$, Tree-Backup$(λ)$, and Retrace$(λ)$, and improve the best known bounds of $Q$-trace in [19]. Moreover, we show the bias-variance trade-offs in each of these algorithms.

研究动机与目标

  • 为求解广义贝尔曼方程的一般离策略TD学习算法建立有限样本收敛保证。
  • 解决由重要性采样比率引起的离策略TD学习中高方差问题。
  • 在统一的理论框架下统一分析并分析多个现有算法——Qπ(λ)、Tree-Backup(λ)、Retrace(λ)和Q-trace。
  • 通过显式的样本复杂度界揭示这些算法固有的偏差-方差权衡。

提出的方法

  • 将离策略TD学习建模为马尔可夫随机逼近算法,其目标是广义贝尔曼算子的不动点。
  • 定义广义贝尔曼算子为B(Q) = T(H(Q) - Q) + Q,其中H为目标算子,T控制压缩性质。
  • 证明广义贝尔曼算子在所有p ∈ [1, ∞)的加权ℓp-范数下为压缩映射,且压缩因子对所有p一致。
  • 利用ℓp-范数下统一的压缩性质,推导出精度ε下样本复杂度为Õ(ε⁻²)的紧致有限样本界。
  • 构造一个具有严格正元素的支配随机矩阵M'',以确保存在唯一的正平稳分布,从而支持范数压缩分析。
  • 将结果应用于推导Qπ(λ)、Tree-Backup(λ)、Retrace(λ)和Q-trace的样本复杂度界,优于先前工作。

实验结果

研究问题

  • RQ1能否开发一个统一的理论框架,以分析离策略TD学习算法的有限样本收敛性?
  • RQ2在所有p ∈ [1, ∞)的加权ℓp-范数下,广义贝尔曼算子成为压缩映射的条件是什么?
  • RQ3Qπ(λ)、Tree-Backup(λ)和Retrace(λ)等离策略算法的偏差与方差在样本复杂度上如何权衡?
  • RQ4与先前工作相比,能否为Q-trace建立更紧致的有限样本界,特别是关于状态-动作空间依赖性的改进?
  • RQ5广义重要性采样比率在决定离策略TD学习收敛速度方面起什么作用?

主要发现

  • 广义贝尔曼算子在所有p ∈ [1, ∞)的加权ℓp-范数下为压缩映射,且压缩因子一致,从而支持紧致的有限样本分析。
  • 所提出的框架首次为Qπ(λ)、Tree-Backup(λ)和Retrace(λ)提供了有限样本界,填补了文献中的空白。
  • 对于Q-trace,样本复杂度相比[19]中先前的最佳结果至少提升了|S||A|倍,显著降低了对状态-动作空间大小的依赖。
  • 有限样本界显式揭示了各算法固有的偏差-方差权衡,其中方差的降低以偏差增加为代价。
  • 通过构造一个支配转移矩阵的严格正随机矩阵M'',建立了压缩性质,确保存在唯一的正平稳分布。
  • 样本复杂度为Õ(ε⁻²),其中ε为目标精度,问题相关因子涉及广义重要性采样比率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。