Skip to main content
QUICK REVIEW

[论文解读] A Kernel-Based Approach to Non-Stationary Reinforcement Learning in Metric Spaces

Omar Darwiche Domingues, Pierre Ménard|arXiv (Cornell University)|Jul 9, 2020
Reinforcement Learning in Robotics参考文献 32被引用 9
一句话总结

该论文提出 KeRNS,一种基于核函数的强化学习算法,用于度量空间中的非平稳马尔可夫决策过程,通过时间依赖核函数建模环境变化并实现自适应探索。其遗憾界与覆盖维数及 MDP 的总变差量成比例,推广了滑动窗口和指数衰减机制,同时通过代表性状态实现高效实现。

ABSTRACT

In this work, we propose KeRNS: an algorithm for episodic reinforcement learning in non-stationary Markov Decision Processes (MDPs) whose state-action set is endowed with a metric. Using a non-parametric model of the MDP built with time-dependent kernels, we prove a regret bound that scales with the covering dimension of the state-action space and the total variation of the MDP with time, which quantifies its level of non-stationarity. Our method generalizes previous approaches based on sliding windows and exponential discounting used to handle changing environments. We further propose a practical implementation of KeRNS, we analyze its regret and validate it experimentally.

研究动机与目标

  • 为解决在过往知识可能过时的非平稳环境中平衡探索与利用的挑战。
  • 开发一种非参数强化学习算法,通过基于核函数的函数估计适应时变 MDP。
  • 在统一的核框架下,将现有的遗忘机制(如滑动窗口和指数衰减)进行推广。
  • 在温和假设下,为连续度量状态空间中的非平稳强化学习提供遗憾界。
  • 设计一种计算高效的变体 RS-KeRNS,通过代表性状态选择实现每轮常数时间复杂度。

提出的方法

  • KeRNS 使用时间依赖核函数对历史转移进行加权,赋予近期数据更高权重,实现对过时信息的自动遗忘。
  • 通过在度量空间中对状态-动作对进行核平滑,构建 MDP 转移和奖励函数的非参数估计。
  • 通过修改后的 UCB 风格奖励项实现乐观值函数估计,该奖励项依赖于累积核加权访问次数的倒数。
  • 采用代表性状态选择机制以降低计算成本,从而实现每轮复杂度恒定的 RS-KeRNS 变体。
  • 核函数结合时间衰减(通过 η^t)与空间相似性(通过 ρ[u,v]),实现时间遗忘与空间泛化。
  • 通过选择适当的核参数,将滑动窗口和指数衰减机制作为所提时间与空间依赖核框架的特例进行推广。

实验结果

研究问题

  • RQ1基于核的方法能否在具有连续状态-动作空间的非平稳 MDP 中实现遗憾界?
  • RQ2与传统的遗忘机制(如滑动窗口或指数衰减)相比,时间依赖核函数在非平稳强化学习中的表现如何?
  • RQ3是否能在不牺牲遗憾性能的前提下,实现基于核函数强化学习的高效、常数时间每轮实现?
  • RQ4核函数形状(如高斯核与四次核)对环境变化中的适应速度和遗憾有何影响?
  • RQ5当利普希茨常数未知时,算法表现如何?最近邻近似是否足够有效?

主要发现

  • KeRNS 实现的遗憾界与状态-动作空间的覆盖维数及 MDP 随时间的总变差量成比例,量化了非平稳性。
  • 该算法将滑动窗口和指数衰减机制作为所提时间与空间依赖核框架的特例进行推广。
  • RS-KeRNS 通过使用代表性状态实现每轮常数时间复杂度,支持实际部署,同时保持了有利的遗憾-运行时间权衡。
  • 实验结果表明,RS-KeRNS 能够成功跟踪环境变化中的最优策略,优于 Kernel-UCBVI,并与已知环境变化时间的基线方法性能相当。
  • 核函数选择(高斯核与四次核)影响适应速度,四次核在某些设置中表现出更快收敛。
  • 即使真实利普希茨常数未知,算法仍保持有效,这通过在值函数更新中使用最近邻近似得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。