[论文解读] On Online Learning in Kernelized Markov Decision Processes
本文提出 GP-UCRL 和后验抽样算法,用于在连续状态和连续动作的马尔可夫决策过程(MDP)中进行在线强化学习,使用高斯过程先验来建模平滑的转移和奖励函数。该工作建立了依赖于新型核相关信息增益度量的次线性遗憾边界,将核带 bandit 的结果推广至 MDP,为非参数核化 MDP 提供了首个频率学派遗憾保证。
We consider online learning for minimizing regret in unknown, episodic Markov decision processes (MDPs) with continuous states and actions. We develop variants of the UCRL and posterior sampling algorithms that employ nonparametric Gaussian process priors to generalize across the state and action spaces. When the transition and reward functions of the true MDP are members of the associated Reproducing Kernel Hilbert Spaces of functions induced by symmetric psd kernels (frequentist setting), we show that the algorithms enjoy sublinear regret bounds. The bounds are in terms of explicit structural parameters of the kernels, namely a novel generalization of the information gain metric from kernelized bandit, and highlight the influence of transition and reward function structure on the learning performance. Our results are applicable to multidimensional state and action spaces with composite kernel structures, and generalize results from the literature on kernelized bandits, and the adaptive control of parametric linear dynamical systems with quadratic costs.
研究动机与目标
- 为具有连续状态和动作的周期性 MDP 开发在线学习算法,其中动态和奖励是平滑的,并属于再生核希尔伯特空间(RKHS)。
- 将核化带 bandit 结果——特别是信息增益度量——扩展至 MDP 的时序和状态依赖设置。
- 在频率学派设定下,为核化 MDP 中的在线强化学习提供有限时间、高概率的遗憾边界。
- 将现有关于参数化 LQR 和 UCRL/PSRL 的结果推广至非参数、无限维、基于核的 MDP。
- 利用 RKHS 值鞅的集中不等式,推导理论保证。
提出的方法
- 提出 GP-UCRL 和后验抽样(PSRL)变体,使用高斯过程先验来建模连续 MDP 中未知的转移和奖励函数。
- 将真实转移和奖励函数建模为由对称正定核诱导的 RKHS 元素,从而实现在状态和动作上的非参数泛化。
- 为核化 MDP 定义一种新颖的信息增益推广形式——γT(R) 和 γmT(P),用于捕捉在 T 次交互后对真实动态和奖励的最大信息增益。
- 利用 RKHS 值鞅的集中界来控制价值函数和策略遗憾中的估计误差,依赖于后验方差和核结构。
- 通过 GP 后验方差和置信宽度参数 βR,l 和 βP,l,构建真实奖励和转移函数的高概率置信集。
- 通过将最优策略与学习策略的价值差异分解为奖励和转移函数的估计误差,然后利用核相关的特定信息增益项分别界定每一项,推导出遗憾边界。
实验结果
研究问题
- RQ1当真实转移和奖励函数是平滑的且属于 RKHS 时,连续状态和连续动作 MDP 中的在线强化学习能否实现次线性遗憾?
- RQ2核的选择如何影响核化 MDP 中的遗憾性能,是否能通过广义信息增益度量进行量化?
- RQ3核化带 bandit 的理论框架能否扩展至具有状态演化和有限时域规划的 MDP 时序决策设置?
- RQ4GP-UCRL 和后验抽样在核化 MDP 中的有限时间遗憾边界是什么?其如何依赖于核的结构特性?
- RQ5能否利用 RKHS 值过程的集中不等式,推导出非参数 MDP 中的高概率遗憾边界?
主要发现
- GP-UCRL 的遗憾以高概率被界定为 Õ(γT(R) + γmT(P))√T,其中 γT(R) 和 γmT(P) 是奖励和转移函数的新信息增益度量。
- 对于平方指数核,信息增益项 γT(R) 和 γmT(P) 的尺度为 polylog(T),导致在 d 维状态和动作空间中,遗憾边界为 Õ(√T log^d T)。
- 后验抽样算法(PSRL)以高概率实现贝叶斯遗憾边界 O(αR,τ exp(γH−1(kR,Z))√(γT(kR,Z)T)) + O(αP,τ exp(γmH−1(kP,Z̃))√(γmT(kP,Z̃)T))。
- 遗憾边界显式依赖于通过信息增益体现的核结构,表明更平滑的核(如平方指数核)可带来更优的遗憾性能。
- 该分析将核带 bandit 结果推广至 MDP,将参数化 LQR 遗憾边界扩展至非参数、基于核的 MDP,且函数空间为无限维。
- 该结果是首次为核化 MDP 中在线学习提供频率学派遗憾保证,为基于平滑性假设的非参数强化学习建立了理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。