Skip to main content
QUICK REVIEW

[论文解读] Policy Evaluation in Continuous MDPs with Efficient Kernelized Gradient Temporal Difference

Alec Koppel, Garrett Warnell|arXiv (Cornell University)|Sep 13, 2017
Reinforcement Learning in Robotics被引用 5
一句话总结

该论文提出了一种简洁核梯度时序差分(PKGTD)学习方法,这是一种在再生核希尔伯特空间(RKHS)中使用核函数逼近的非参数、内存高效的策略评估方法,适用于连续MDP。该方法结合了随机拟梯度法与稀疏子空间投影,实现了在递减步长下的几乎必然收敛至贝尔曼不动点,以及在常数步长下的均值收敛至邻域,同时保持有限的模型复杂度。

ABSTRACT

We consider policy evaluation in infinite-horizon discounted Markov decision problems (MDPs) with infinite spaces. We reformulate this task a compositional stochastic program with a function-valued decision variable that belongs to a reproducing kernel Hilbert space (RKHS). We approach this problem via a new functional generalization of stochastic quasi-gradient methods operating in tandem with stochastic sparse subspace projections. The result is an extension of gradient temporal difference learning that yields nonlinearly parameterized value function estimates of the solution to the Bellman evaluation equation. Our main contribution is a memory-efficient non-parametric stochastic method guaranteed to converge exactly to the Bellman fixed point with probability $1$ with attenuating step-sizes. Further, with constant step-sizes, we obtain mean convergence to a neighborhood and that the value function estimates have finite complexity. In the Mountain Car domain, we observe faster convergence to lower Bellman error solutions than existing approaches with a fraction of the required memory.

研究动机与目标

  • 解决无限时域连续MDP中稳定且内存高效的值函数估计问题,其状态空间与动作空间均为紧致的。
  • 开发一种非参数方法,可在无需固定基集的情况下表示复杂的值函数,从而实现灵活的非线性函数逼近。
  • 在较弱假设下实现对真实值函数的收敛,即使在无限维函数空间中亦可。
  • 通过稀疏子空间投影保持有限的模型复杂度,使该方法适用于实际应用场景。
  • 相较于现有方法,实现更快的收敛速度与更低的贝尔曼误差,同时显著降低内存使用量。

提出的方法

  • 将策略评估重新表述为一个函数值决策变量的复合随机规划问题,定义于再生核希尔伯特空间(RKHS)中。
  • 引入一种功能型随机拟梯度法,与随机稀疏子空间投影并行运行,以维持模型复杂度。
  • 提出简洁核梯度时序差分(PKGTD)算法,采用自适应压缩机制的核化时序差分更新。
  • 应用基于核函数的时序差分更新,同时结合即时奖励与自举值估计。
  • 采用一种压缩机制,限制支持向量的数量,确保在常数步长与固定预算下保持有限的模型阶数。
  • 利用RKHS的再生性质,实现高效的函数梯度更新,同时保留收敛性保证。

实验结果

研究问题

  • RQ1非参数核方法是否能在紧致状态与动作空间的连续MDP中实现对贝尔曼不动点的几乎必然收敛?
  • RQ2在不牺牲收敛性的前提下,如何在非线性函数逼近中确保内存效率?
  • RQ3稀疏子空间投影对RKHS中随机梯度方法的收敛性与复杂度有何影响?
  • RQ4与现有方法相比,该方法是否能在显著减少内存占用的同时实现更快的收敛速度与更低的贝尔曼误差?
  • RQ5在常数步长下,如何为具有有限模型复杂度的均值收敛提供理论保证?

主要发现

  • 当使用衰减步长时,在真实值函数属于RKHS的假设下,PKGTD以概率1实现对贝尔曼不动点的几乎必然收敛。
  • 在常数步长与固定压缩预算下,该方法保证均值收敛至真实值函数的邻域,且模型复杂度有限。
  • 在Mountain Car环境中,PKGTD相较于现有方法收敛更快,贝尔曼误差更低,同时内存使用量仅为后者的极小部分。
  • 该算法始终维持有限数量的支持向量,确保模型复杂度有界,且模型阶数对所有 $t$ 均被有界于 $M^{ u}$。
  • 理论分析表明,函数型随机拟梯度序列保持有界,且投影机制确保了有限的覆盖维数,从而支持实际实现。
  • 该方法建立了函数梯度的统一确定性上界,支持有限覆盖论证,并确保压缩表示的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。