[论文解读] Learning and Planning in Average-Reward Markov Decision Processes
本文提出了针对平均奖励马尔可夫决策过程的新型离策略无模型学习与规划算法,包括差分Q-learning和差分TD-learning,这些算法在不依赖参考状态或参考函数的情况下收敛至真实的值函数。主要贡献在于实现了对真实值函数的收敛(而非受未知常数偏移影响的值函数),通过使用时序差分误差来更新平均奖励估计,从而在表格型和线性函数逼近设置下均实现了无需参考状态的稳健学习。
We introduce learning and planning algorithms for average-reward MDPs, including 1) the first general proven-convergent off-policy model-free control algorithm without reference states, 2) the first proven-convergent off-policy model-free prediction algorithm, and 3) the first off-policy learning algorithm that converges to the actual value function rather than to the value function plus an offset. All of our algorithms are based on using the temporal-difference error rather than the conventional error when updating the estimate of the average reward. Our proof techniques are a slight generalization of those by Abounadi, Bertsekas, and Borkar (2001). In experiments with an Access-Control Queuing Task, we show some of the difficulties that can arise when using methods that rely on reference states and argue that our new algorithms can be significantly easier to use.
研究动机与目标
- 解决在平均奖励MDP中缺乏通用、收敛的离策略无模型控制算法的问题,且无需依赖参考状态。
- 开发一种预测算法,使其收敛至真实值函数与奖励率,而非受未知偏移影响的值函数。
- 消除对参考函数的依赖,这些参考函数可能需要事先知道频繁访问的状态-动作对,而这些信息可能等价于提前知晓部分解。
- 在保持对超参数选择鲁棒性的同时,将收敛性保证扩展至线性函数逼近设置。
提出的方法
- 提出差分Q-learning,一种离策略控制算法,显式维护平均奖励的估计值,并利用时序差分误差进行更新,避免使用参考状态。
- 提出差分TD-learning,一种新颖的离策略预测算法,通过基于时序差分误差的更新,收敛至真实的奖励率与差分值函数。
- 将Abounadi等人(2001)的收敛性证明技术推广至无参考状态的情形,确保收敛至真实值函数。
- 将时序差分误差作为平均奖励与值函数估计的主要更新信号,而非传统误差形式。
- 在实验中采用基于瓦片编码的线性函数逼近,以评估在连续状态设置下的可扩展性与鲁棒性。
- 采用在线、增量式更新而非批处理方式,支持在持续任务中实现实时学习。
实验结果
研究问题
- RQ1能否设计一种不依赖参考状态或参考函数的离策略、无模型控制算法,用于平均奖励MDP?
- RQ2能否开发一种预测算法,使其收敛至真实值函数与奖励率,而非受未知常数偏移影响的函数?
- RQ3使用时序差分误差进行平均奖励估计,是否相比传统方法能提升收敛性与鲁棒性?
- RQ4在超参数选择的鲁棒性方面,无参考状态算法与基于参考的算法(如RVI Q-learning)相比表现如何?
- RQ5所提出的算法能否成功扩展至线性函数逼近设置,同时保持收敛性与性能?
主要发现
- 差分Q-learning在无需参考状态的情况下实现了对真实值函数的收敛,解决了平均奖励强化学习中长期存在的局限性。
- 该算法对超参数选择具有鲁棒性,学习性能在广泛的学习率与步长范围内保持稳定,尤其在学习率η方面表现突出。
- 在Catcher问题中,差分Q-learning在使用基于瓦片编码的线性函数逼近时,实现了约0.9的奖励率,接近最优的1.0。
- RVI Q-learning的性能对参考函数的选择极为敏感,当参考状态未被频繁访问时,性能显著下降。
- 在RVI Q-learning中,使用首次观测到的特征向量作为参考,在一维Catcher领域中的表现优于二维PuckWorld领域,表明其对环境结构具有敏感性。
- 差分TD-learning是首个被证明收敛的离策略无模型预测算法,适用于平均奖励MDP,能够准确估计奖励率与差分值函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。