Skip to main content
QUICK REVIEW

[论文解读] Sample Complexity Bounds for Two Timescale Value-based Reinforcement Learning Algorithms

Tengyu Xu, Yingbin Liang|arXiv (Cornell University)|Nov 10, 2020
Reinforcement Learning in Robotics被引用 6
一句话总结

本文首次对在常数步长下采用马尔可夫采样机制的双时标值函数强化学习算法——线性TDC与非线性TDC、Greedy-GQ——提供了非渐近收敛性分析。在常数步长下,线性TDC的最优样本复杂度为$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$,非线性TDC与Greedy-GQ的样本复杂度为$\mathcal{O}(\epsilon^{-2})$,显著优于以往结果,并为广泛使用的强化学习算法提供了实用的有限样本保证。

ABSTRACT

Two timescale stochastic approximation (SA) has been widely used in value-based reinforcement learning algorithms. In the policy evaluation setting, it can model the linear and nonlinear temporal difference learning with gradient correction (TDC) algorithms as linear SA and nonlinear SA, respectively. In the policy optimization setting, two timescale nonlinear SA can also model the greedy gradient-Q (Greedy-GQ) algorithm. In previous studies, the non-asymptotic analysis of linear TDC and Greedy-GQ has been studied in the Markovian setting, with diminishing or accuracy-dependent stepsize. For the nonlinear TDC algorithm, only the asymptotic convergence has been established. In this paper, we study the non-asymptotic convergence rate of two timescale linear and nonlinear TDC and Greedy-GQ under Markovian sampling and with accuracy-independent constant stepsize. For linear TDC, we provide a novel non-asymptotic analysis and show that it attains an $\\epsilon$-accurate solution with the optimal sample complexity of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$ under a constant stepsize. For nonlinear TDC and Greedy-GQ, we show that both algorithms attain $\\epsilon$-accurate stationary solution with sample complexity $\\mathcal{O}(\\epsilon^{-2})$. It is the first non-asymptotic convergence result established for nonlinear TDC under Markovian sampling and our result for Greedy-GQ outperforms the previous result orderwisely by a factor of $\\mathcal{O}(\\epsilon^{-1}\\log(1/\\epsilon))$.

研究动机与目标

  • 填补在常数步长下双时标值函数强化学习的非渐近收敛性分析空白,此类方法在实践中广泛应用,但缺乏有限样本保证。
  • 在仅知渐近收敛性的设定下,首次为非线性TDC在马尔可夫采样下建立非渐近收敛速率。
  • 在常数步长下,将Greedy-GQ的样本复杂度提升至优于以往结果的水平,实现$\mathcal{O}(\epsilon^{-2})$。
  • 统一分析线性和非线性双时标随机逼近(SA)在强化学习策略评估与优化问题中的应用。

提出的方法

  • 为在马尔可夫采样下采用常数步长的双时标随机逼近(SA)开发了一套新颖的非渐近分析框架。
  • 利用李雅普诺夫函数技术和递归不等式,对迭代值与最优解之间的期望平方误差进行有界控制。
  • 通过仔细分析快慢时标之间的相互作用,特别是快速变量对慢速变量的误差传播,建立收敛速率。
  • 提出一个关键不等式(公式59),用于通过快速变量的跟踪误差与梯度范数来有界慢速变量的累积误差。
  • 施加最小化假设——无需全局稳定性或局部线性化条件——从而可广泛适用于非线性函数逼近。
  • 通过将迭代次数$T$与期望精度$\epsilon$关联,并以平均梯度范数作为收敛度量,推导出样本复杂度边界。

实验结果

研究问题

  • RQ1在马尔可夫采样下,常数步长的线性TDC的非渐近样本复杂度是多少?
  • RQ2在缺乏先前有限样本分析的前提下,能否为在马尔可夫采样下采用常数步长的非线性TDC建立非渐近收敛速率?
  • RQ3在常数步长下,Greedy-GQ的样本复杂度与采用递减或$\epsilon$-相关步长的先前结果相比如何?
  • RQ4该分析能否扩展至无需严格假设(如局部线性化或全局稳定性)的非线性双时标SA?
  • RQ5在实际采样条件下,双时标强化学习算法中步长选择与收敛速率之间是否存在最优权衡?

主要发现

  • 线性TDC算法在常数步长下实现$\epsilon$-精度解的样本复杂度为$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$,该结果为最优。
  • 首次在马尔可夫采样下为非线性TDC建立了非渐近收敛结果,样本复杂度为$\mathcal{O}(\epsilon^{-2})$。
  • Greedy-GQ算法在常数步长下实现$\mathcal{O}(\epsilon^{-2})$的样本复杂度,相比以往结果提升了$\mathcal{O}(\epsilon^{-1}\log(1/\epsilon))$的因子。
  • 该分析无需局部线性化或全局稳定性等限制性假设,因此适用于一般非线性函数逼近。
  • 收敛速率基于常数步长推导,该方法在实际强化学习应用中具有实用性且广泛应用。
  • 所推导的边界为紧致边界,与马尔可夫采样下非凸随机优化的理论下界一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。