[论文解读] Predecessor Features
本文提出了一种名为前驱特征(Predecessor Features)的自举时序差分学习方法,通过学习预期的折扣过去状态特征之和,将信用分配扩展至近期状态之外。通过利用后继表示(successor representation)将时序差分误差传播至相关前驱状态,该方法在表格型和函数逼近设置中均加速了学习并改进了价值函数逼近,优于标准的TD(λ)及其相关方法,在网格世界和深度强化学习任务中表现更优。
Any reinforcement learning system must be able to identify which past events contributed to observed outcomes, a problem known as credit assignment. A common solution to this problem is to use an eligibility trace to assign credit to recency-weighted set of experienced events. However, in many realistic tasks, the set of recently experienced events are only one of the many possible action events that could have preceded the current outcome. This suggests that reinforcement learning can be made more efficient by allowing credit assignment to any viable preceding state, rather than only those most recently experienced. Accordingly, we examine ``Predecessor Features'', the fully bootstrapped version of van Hasselt's ``Expected Trace'', an algorithm that achieves this richer form of credit assignment. By maintaining a representation that approximates the expected sum of past occupancies, this algorithm allows temporal difference (TD) errors to be propagated accurately to a larger number of predecessor states than conventional methods, greatly improving learning speed. The algorithm can also be naturally extended from tabular state representation to feature representations allowing for increased performance on a wide range of environments. We demonstrate several use cases for Predecessor Features and compare its performance with other approaches.
研究动机与目标
- 为解决标准TD学习中资格迹仅对近期事件进行信用分配的局限性,通过允许对任意可行的前驱状态进行信用分配。
- 形式化后继表示与资格迹之间的关系,从而建立更丰富的信用分配机制。
- 开发一种完全自举的算法——前驱特征(Predecessor Features),直接学习折扣前驱特征的期望和。
- 在表格型和深度强化学习环境中,展示改进的学习效率与价值函数逼近准确性。
- 将前驱特征确立为van Hasselt的期望迹(Expected Trace)算法的特例,从而实现更广泛的应用。
提出的方法
- 该方法使用后继表示(SR)计算从任一给定状态出发的未来状态的预期折扣访问频率,从而实现将时序差分误差向相关过去状态的反向传播。
- 它提出了一种表格型算法TD-PR,维护一个矩阵Ψ以近似SR,并利用该矩阵通过前驱状态的资格迹传播TD误差。
- 在函数逼近方面,提出了线性TD-PF,通过一个独立的权重矩阵Ψ学习前驱状态的基于特征的表示,并使用梯度下降法更新该矩阵。
- 该算法通过使用预测的前驱特征zθ(S_t) = Ψx(S_t)作为资格迹实现自举更新,从而实现误差向非近期状态的传播。
- 该方法采用两个学习率:α用于价值函数权重w,β用于前驱特征矩阵Ψ,从而实现对价值和前驱表示的独立优化。
- 该方法在理论上被证明是van Hasselt的期望迹(ET)算法在η=1时的特例,因此是完全自举且高效的。
实验结果
研究问题
- RQ1是否可以通过将时序差分误差传播至任意可行的前驱状态(而不仅限于近期状态)来改进时序差分学习中的信用分配?
- RQ2如何调整后继表示以表示折扣前驱状态的期望和,从而实现更有效的信用分配?
- RQ3在表格型和深度强化学习设置中,前驱特征相较于标准TD(λ)和期望迹方法的性能增益如何?
- RQ4前驱特征的自举特性与非自举替代方法相比,对学习稳定性与收敛速度有何影响?
- RQ5前驱特征能否在函数逼近中有效实现,且在高维状态空间中是否仍能保持性能优势?
主要发现
- 在Plinko(Pachinko)网格世界任务中,TD-PR在所有测试超参数设置下(包括α-m较低时)均优于TD(λ),在收敛速度和准确性方面表现更优。
- 在使用深度神经网络函数逼近的Cartpole环境中,前驱特征算法略胜于非自举的期望迹(ET)方法,表现出更高的样本效率。
- 当后继表示矩阵(α-m)的学习率设为适中值(0.1)时,前驱特征算法比TD(λ)更快收敛至真实价值函数。
- 在表格型情况下,该方法成功学习了SR矩阵,Ψ矩阵近似真实后继表示,并实现了对前驱状态的准确信用分配。
- 该算法在理论上等价于van Hasselt的期望迹算法在η=1时的情形,证实了其理论基础,并将其适用范围扩展至完全自举的信用分配。
- 与蒙特卡洛方法相比,前驱特征降低了价值函数逼近的方差,同时保持了低方差更新,从而实现了更稳定的训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。