Skip to main content
QUICK REVIEW

[论文解读] Non-stationary Reinforcement Learning without Prior Knowledge: An Optimal Black-box Approach

Chen-Yu Wei, Haipeng Luo|arXiv (Cornell University)|Feb 10, 2021
Advanced Bandit Algorithms Research参考文献 61被引用 17
一句话总结

本文提出 MASTER,一种黑箱归约方法,可将任意在平稳环境中具有最优遗憾的强化学习算法,转化为在非平稳环境中实现最优动态遗憾的算法,且无需事先了解非平稳性的相关信息(例如变化次数或变化幅度)。该方法在多臂赌博机、上下文赌博机、线性与广义线性赌博机、回合制与无限时域马尔可夫决策过程等多种设置中,均实现了最小最大最优的动态遗憾界 $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$。

ABSTRACT

We propose a black-box reduction that turns a certain reinforcement learning algorithm with optimal regret in a (near-)stationary environment into another algorithm with optimal dynamic regret in a non-stationary environment, importantly without any prior knowledge on the degree of non-stationarity. By plugging different algorithms into our black-box, we provide a list of examples showing that our approach not only recovers recent results for (contextual) multi-armed bandits achieved by very specialized algorithms, but also significantly improves the state of the art for (generalized) linear bandits, episodic MDPs, and infinite-horizon MDPs in various ways. Specifically, in most cases our algorithm achieves the optimal dynamic regret $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, Δ^{1/3}T^{2/3}\})$ where $T$ is the number of rounds and $L$ and $Δ$ are the number and amount of changes of the world respectively, while previous works only obtain suboptimal bounds and/or require the knowledge of $L$ and $Δ$.

研究动机与目标

  • 解决在缺乏对非平稳性程度先验知识的前提下,实现非平稳强化学习中最优动态遗憾的挑战。
  • 开发一种通用、即插即用的框架,适用于多种强化学习设置,包括赌博机与马尔可夫决策过程。
  • 克服先前方法的局限性,这些方法需依赖 $L$(变化次数)或 $\Delta$(变化幅度)才能实现最优性能。
  • 实现与理论最小最大下界相匹配的最优动态遗憾界,且无需对环境转移做任何假设。

提出的方法

  • 提出一种黑箱归约框架 MASTER,可将任意在平稳环境中具有最优遗憾的强化学习算法,转化为在非平稳环境中实现最优动态遗憾的算法。
  • 采用时间依赖的加权策略与自适应置信区间,平衡探索与对环境变化的适应能力。
  • 通过受赌博机算法启发但适配于通用强化学习的归约方法,维护一个策略的概率分布,并控制奖励估计器的方差。
  • 将基础算法如 UCB1、OFUL、FALCON、LSVI-UCB 和 UCRL 集成到 MASTER 中,以在各类设置中实现最优遗憾。
  • 利用 Freedman 不等式与集中不等式,控制在环境变化条件下的估计误差与遗憾分解。
  • 通过根据观测到的偏差动态调整探索策略,确保方法对未知的 $L$ 和 $\Delta$ 具备鲁棒性。

实验结果

研究问题

  • RQ1能否设计一种通用的黑箱归约方法,在缺乏对 $L$ 或 $\Delta$ 先验知识的前提下,实现非平稳强化学习中的最优动态遗憾?
  • RQ2该归约方法能否适用于多种强化学习设置,包括多臂赌博机、上下文赌博机以及马尔可夫决策过程?
  • RQ3该方法是否能在不依赖 $L$ 或 $\Delta$ 的前提下,实现最小最大最优的遗憾界 $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$?
  • RQ4与专用算法相比,该框架在遗憾性能与适应能力方面表现如何?

主要发现

  • MASTER 在所有测试设置中均实现了最小最大最优的动态遗憾界 $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$,且无需事先了解 $L$ 或 $\Delta$。
  • 在多臂与上下文赌博机中,MASTER 搭配 UCB1 或 ILTCB 可恢复 Auer 等人(2019)与 Chen 等人(2019)的最先进遗憾界,且无需任何先验知识。
  • 在线性与广义线性赌博机中,MASTER 搭配 OFUL 或 GLM-UCB 在消除对 $\Delta$ 或 $L$ 依赖的同时,实现了与先前工作相同的最优遗憾。
  • 在回合制马尔可夫决策过程中,MASTER 搭配 Q-UCB 或 LSVI-UCB 实现了 $\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\}$ 的遗憾,优于先前需依赖 $\Delta$ 或遗憾界次优的方法。
  • 在无限时域马尔可夫决策过程中,MASTER 搭配 UCRL 实现了 $\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\}$ 的遗憾,达到最优边界,并优于先前需依赖 $\Delta$ 或 $L$ 的方法。
  • 该框架具有普适性:将任意基于 UCB 或在平稳环境中表现最优的强化学习算法接入 MASTER,即可在非平稳环境中获得动态遗憾最优的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。