Skip to main content
QUICK REVIEW

[论文解读] Temporal Difference Updating without a Learning Rate

Marcus Hütter, Shane Legg|ArXiv.org|Oct 31, 2008
Reinforcement Learning in Robotics参考文献 9被引用 16
一句话总结

本文提出 HL(λ),一种时序差分学习算法,通过变分方法基于统计原理推导学习率,从而消除了对人工调校学习率 α 的依赖。该方法基于优势追踪和经验奖励统计,采用与状态相关的学习率,在无需超参数调优的情况下,于多个环境中均优于标准 TD(λ)、Sarsa(λ) 和 Q(λ)。

ABSTRACT

We derive an equation for temporal difference learning from statistical principles. Specifically, we start with the variational principle and then bootstrap to produce an updating rule for discounted state value estimates. The resulting equation is similar to the standard equation for temporal difference learning with eligibility traces, so called TD(lambda), however it lacks the parameter alpha that specifies the learning rate. In the place of this free parameter there is now an equation for the learning rate that is specific to each state transition. We experimentally test this new learning rule against TD(lambda) and find that it offers superior performance in various settings. Finally, we make some preliminary investigations into how to extend our new temporal difference algorithm to reinforcement learning. To do this we combine our update equation with both Watkins' Q(lambda) and Sarsa(lambda) and find that it again offers superior performance without a learning rate parameter.

研究动机与目标

  • 消除时序差分学习中对人工调校学习率的依赖。
  • 从统计推断出发,推导出基于原理、数据驱动的学习率,而非基于启发式设计。
  • 提升在值函数估计与策略学习任务中的学习稳定性和性能。
  • 将新学习规则扩展至完整的强化学习算法,如 Sarsa(λ) 和 Q(λ)。
  • 在平稳、非平稳及回合制环境中验证该方法。

提出的方法

  • 从最小化估计未来折扣奖励与经验未来折扣奖励之间加权平方误差和的变分原理中推导学习率。
  • 使用带参数 λ 的时间加权损失函数,对较早的状态转移进行折扣,从而在非平稳环境中实现自适应。
  • 将 TD(λ) 中固定的 α 学习率替换为基于归一化轨迹加权计数与优势追踪倒数的、与状态-动作转移相关的学习率 β。
  • 在增量更新规则中应用推导出的学习率:V(s) ← V(s) + β × E(s) × δ,其中 δ 为时序差分误差。
  • 通过将基于 β 的更新规则整合到 Sarsa(λ) 和 Watkins 的 Q(λ) 中,将方法扩展至 Q 学习,形成 HLS(λ) 和 HLQ(λ)。
  • 采用运行计数 N(s,a) 和优势追踪 E(s,a) 来追踪访问频率与时间信用分配,其中 λ 用于衰减两者。

实验结果

研究问题

  • RQ1能否从统计推断中推导出一种基于原理、数据驱动的学习率,以替代 TD(λ) 中启发式设计的 α?
  • RQ2所得到的 HL(λ) 算法是否在不同马尔可夫链环境中均优于标准 TD(λ) 的值函数估计性能?
  • RQ3HL(λ) 中的学习率自适应机制是否能提升非平稳环境中的性能,优于固定 α 方法?
  • RQ4消除学习率超参数是否能带来在 Sarsa(λ) 和 Q(λ) 等完整强化学习算法中的更优性能?
  • RQ5HL(λ) 框架能否推广至其他时序差分算法,且不损失性能或增加复杂度?

主要发现

  • HL(λ) 在平稳与非平稳马尔可夫链中均优于标准 TD(λ),在值函数估计中实现了更低的误差。
  • 在风向网格世界环境中,HLS(λ) 达到了超过 5.0 的最终经验未来折扣奖励,优于最佳调校的 Sarsa(λ),后者始终低于 5.0。
  • 即使在 λ=0.99 的情况下,Sarsa(λ) 也无法达到 HLS(λ) 的最终性能,证明了数据驱动学习率的优势。
  • HLQ(λ) 作为 HL(λ) 在 Q 学习中的扩展,即使未调校学习率,性能也优于 Q(λ),尽管进行了广泛的超参数搜索。
  • 该方法在多次运行和多种环境中均表现出一致的优越性,性能提升归因于对每个状态-转移的自适应学习率。
  • 该算法在保持竞争性训练速度的同时,消除了对人工调校 α 的需求,表明其在实际强化学习应用中具有实用优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。