Skip to main content
QUICK REVIEW

[论文解读] A First Empirical Study of Emphatic Temporal Difference Learning

Sina Ghiassian, Banafsheh Rafiee|arXiv (Cornell University)|May 11, 2017
Reinforcement Learning in Robotics参考文献 5被引用 8
一句话总结

本论文首次对强调性时序差分学习(ETD)进行了实证研究,通过修改后的Mountain Car环境,在on-policy与off-policy设置下将其与传统的TD(0)进行比较。ETD在两种设置下均实现了比TD(0)更低的渐近误差性能,且无'反弹'效应;尽管由于方差较高需采用更小的学习率,其在off-policy场景下的收敛速度更慢。

ABSTRACT

In this paper we present the first empirical study of the emphatic temporal-difference learning algorithm (ETD), comparing it with conventional temporal-difference learning, in particular, with linear TD(0), on on-policy and off-policy variations of the Mountain Car problem. The initial motivation for developing ETD was that it has good convergence properties under off-policy training (Sutton, Mahmood and White 2016), but it is also a new algorithm for the on-policy case. In both our on-policy and off-policy experiments, we found that each method converged to a characteristic asymptotic level of error, with ETD better than TD(0). TD(0) achieved a still lower error level temporarily before falling back to its higher asymptote, whereas ETD never showed this kind of "bounce". In the off-policy case (in which TD(0) is not guaranteed to converge), ETD was significantly slower.

研究动机与目标

  • 对强调性时序差分学习(ETD)在on-policy与off-policy强化学习设置下的性能进行实证评估。
  • 从收敛速度、渐近误差和不同学习率下的稳定性三个方面,将ETD与标准TD(0)进行比较。
  • 探究ETD在off-policy训练下具备的理论收敛保证是否在实际的on-policy学习中也成立。
  • 考察学习率选择与学习动态对误差轨迹的影响,特别是ETD中'反弹'现象的缺失。
  • 通过实证结果验证理论反例:当λ随状态变化时,TD(λ)在on-policy训练下可能发散。

提出的方法

  • ETD使用后续追踪F_t根据状态访问频率来强调或弱化更新,计算方式为F_t = ρ_{t-1}F_{t-1} + 1,其中F_0 = 1。
  • 更新规则为θ_{t+1} ← θ_t + αρ_t F_t (R_{t+1} + θ_t^T φ_{t+1} - θ_t^T φ_t) φ_t,其中ρ_t = π(A_t|S_t)/μ(A_t|S_t)。
  • 在on-policy设置中,ρ_t = 1,但ETD仍与TD(0)不同,因为F_t加权机制增强了学习的稳定性。
  • 在off-policy设置中,μ ≠ π,ETD在策略不匹配下仍能保持收敛,而标准TD(0)则不能。
  • 研究使用了一个固定策略的Mountain Car测试平台,通过500个采样状态计算MSVE,即估计值函数与真实值函数之间的加权均方误差。
  • 学习曲线在500,000个episode内评估,MSVE取最后1% episode的平均值以评估渐近性能。

实验结果

研究问题

  • RQ1在on-policy强化学习中,ETD是否在渐近均方值误差(MSVE)方面优于TD(0)?
  • RQ2在不同学习率下,'反弹'现象——即误差先短暂降低后上升——在TD(0)与ETD中如何表现?
  • RQ3ETD能否在TD(0)无法保证收敛的off-policy设置中实现稳定收敛?
  • RQ4在on-policy与off-policy场景下,ETD与TD(0)的最优学习率α范围是什么?
  • RQ5理论反例中,当λ随状态变化时,TD(λ)在on-policy训练下可能发散,这一结论在实证结果中是否成立?

主要发现

  • 在on-policy设置中,ETD在所有学习率下均实现了比TD(0)更低的渐近MSVE,且未观察到任何反弹效应。
  • TD(0)在所有学习率下均表现出典型的'反弹'现象——误差先短暂下降后回升至更高渐近水平,且该现象的持续时间随α减小而延长。
  • 当α < 10^{-4}时,TD(0)在500,000个episode内未能收敛,而ETD在适当小的学习率(如~10^{-7})下仍能保持稳定收敛。
  • 在off-policy设置中,ETD实现了比TD(0)更优的渐近性能,但因方差较高,收敛速度显著更慢,需使用极小的学习率。
  • 在off-policy设置中,TD(0)因可使用更大的学习率而收敛更快,但以更高的渐近误差为代价。
  • ETD在所有实验中均未出现反弹现象,证实其稳定性,即使在on-policy场景中,由于F_t加权机制的存在,其性能也与TD(0)不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。