Skip to main content
QUICK REVIEW

[论文解读] Convergent Tree Backup and Retrace with Function Approximation

Abdelaziz Touati, Pierre‐Luc Bacon|arXiv (Cornell University)|May 25, 2017
Reinforcement Learning in Robotics参考文献 32被引用 7
一句话总结

本文从理论和实证两方面识别出在结合线性函数逼近时,Tree Backup 和 Retrace 算法在离策略时序差分学习中存在不稳定性。提出了一种基于梯度的收敛算法——GTB 和 G Retrace,采用凸-凹鞍点公式化方法,确保无需投影或 Polyak 平均即可实现 O(1/k) 的收敛速度,从而在函数逼近下实现稳定且高效的离策略学习。

ABSTRACT

Off-policy learning is key to scaling up reinforcement learning as it allows to learn about a target policy from the experience generated by a different behavior policy. Unfortunately, it has been challenging to combine off-policy learning with function approximation and multi-step bootstrapping in a way that leads to both stable and efficient algorithms. In this work, we show that the extsc{Tree Backup} and extsc{Retrace} algorithms are unstable with linear function approximation, both in theory and in practice with specific examples. Based on our analysis, we then derive stable and efficient gradient-based algorithms using a quadratic convex-concave saddle-point formulation. By exploiting the problem structure proper to these algorithms, we are able to provide convergence guarantees and finite-sample bounds. The applicability of our new analysis also goes beyond extsc{Tree Backup} and extsc{Retrace} and allows us to provide new convergence rates for the GTD and GTD2 algorithms without having recourse to projections or Polyak averaging.

研究动机与目标

  • 识别并分析在离策略时序差分学习中,结合线性函数逼近时 Tree Backup 和 Retrace 算法的不稳定性。
  • 设计新型基于梯度的算法,确保在此设置下的收敛性和稳定性,克服现有方法的局限性。
  • 通过新颖的鞍点公式化方法,建立所提算法的收敛性保证和有限样本界。
  • 将分析扩展至现有算法如 GTD 和 GTD2,改进其收敛速度表征,无需投影或 Polyak 平均。
  • 通过实证验证新算法相较于 GQ(λ) 和 AB-Trace(λ) 等最先进方法的鲁棒性和样本效率。

提出的方法

  • 将策略评估问题公式化为涉及原始变量(函数参数)和对偶变量(时序差分误差)的凸-凹鞍点问题。
  • 推导出随机原始-对偶梯度算法,通过原始变量与对偶变量之间的双线性耦合最小化均方投影贝尔曼误差(MSPBE)。
  • 引入二次正则化项以确保可计算的更新和收敛性,避免使用近端映射或强凸性假设。
  • 应用常微分方程(ODE)方法分析平均动力学,并证明原始 Tree Backup 和 Retrace 在函数逼近下存在不稳定性。
  • 采用一种新颖的分析技术,实现无需依赖 Polyak 平均或投影步骤的 O(1/k) 收敛速度。
  • 将同一框架应用于重新推导并改进 GTD 和 GTD2 算法的收敛速度界。

实验结果

研究问题

  • RQ1为何 Tree Backup 和 Retrace 算法在结合线性函数逼近时无法收敛?
  • RQ2能否设计出一种稳定、收敛且高效的离策略算法,结合函数逼近与多步自举?
  • RQ3所提算法的收敛速度是多少?是否可在无需投影或 Polyak 平均的情况下建立?
  • RQ4所提鞍点框架能否扩展以改进 GTD 和 GTD2 等现有算法的收敛性分析?
  • RQ5在实践中,所提算法与 GQ(λ)、AB-Trace(λ) 及其他最先进方法相比,在鲁棒性和样本效率方面表现如何?

主要发现

  • 通过 ODE 分析和具体反例,理论和实证均表明,当结合线性函数逼近时,Tree Backup 和 Retrace 算法存在不稳定性。
  • 所提 GTB 和 G Retrace 算法在无需投影或 Polyak 平均的情况下实现 O(1/k) 的收敛速度,确保学习过程稳定。
  • 新算法对学习率选择具有鲁棒性,如 NMSE 分布的箱线图所示,GTB(λ) 展现最低方差。
  • G Retrace(λ) 与 AB-Trace(λ) 在不同 λ 值下几乎达到相同的最优 MSPBE 值,证实二者最小化相同的目标函数。
  • NMSE 的第 5 百分位数显示,GQ(λ) 因重要性采样导致高方差,而 GTB 和 G Retrace 表现更稳定且高效。
  • 鞍点框架使 GTD 和 GTD2 的收敛速度分析得到改进,其适用范围超越了原始算法的范畴。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。