[论文解读] Nearly Minimax Optimal Reinforcement Learning for Discounted MDPs
本文提出 UCBVI-γ,一种用于折扣 MDP 的基于模型强化学习算法,通过使用改进的 Bernstein 类奖励项和全方差定律,实现了近乎极小极大最优的遗憾。该文建立了上界 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{1.5})$ 和匹配的下界 $\widetilde{\Omega}(\sqrt{SAT}/(1-\gamma)^{1.5})$,证明了在对数因子范围内近乎最优。
We study the reinforcement learning problem for discounted Markov Decision Processes (MDPs) under the tabular setting. We propose a model-based algorithm named UCBVI-$γ$, which is based on the \emph{optimism in the face of uncertainty principle} and the Bernstein-type bonus. We show that UCBVI-$γ$ achieves an $ ilde{O}\big({\sqrt{SAT}}/{(1-γ)^{1.5}}\big)$ regret, where $S$ is the number of states, $A$ is the number of actions, $γ$ is the discount factor and $T$ is the number of steps. In addition, we construct a class of hard MDPs and show that for any algorithm, the expected regret is at least $ ildeΩ\big({\sqrt{SAT}}/{(1-γ)^{1.5}}\big)$. Our upper bound matches the minimax lower bound up to logarithmic factors, which suggests that UCBVI-$γ$ is nearly minimax optimal for discounted MDPs.
研究动机与目标
- 弥合现有在线强化学习算法与折扣 MDP 理论极小极大下界之间的差距。
- 设计一种实用的基于模型的算法,实现近乎最优的遗憾,且无需生成模型。
- 为折扣 MDP 中的遗憾建立近乎匹配的上下界,以确认在对数因子范围内的极小极大最优性。
- 将先前遗憾界改善 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{2.5})$ 的尺度提升 $ (1-\gamma)^{-1} $ 倍。
提出的方法
- UCBVI-γ 算法基于面对不确定性时的乐观(OFU)原则,并引入改进的 Bernstein 类奖励项以收紧置信区间。
- 利用全方差定律更好地控制值函数更新中的估计误差。
- 该方法通过基于经验计数和方差估计的置信区间执行值迭代。
- 提出一种新颖的分析技术,结合集中不等式与时间步长上的递归遗憾分解。
- 该算法通过结合经验奖励与依赖访问次数和方差的奖励项,维护值函数的上置信界。
- 遗憾分析利用时间范围上的递归遗憾分解,并应用柯西-施瓦茨不等式等不等式来界定累积次优性。
实验结果
研究问题
- RQ1基于模型的在线 RL 算法能否在对数因子范围内实现与折扣 MDP 极小极大下界匹配的遗憾?
- RQ2使用改进的 Bernstein 类奖励项是否相比标准 UCB 或 Q-learning 方法能改善遗憾界?
- RQ3在线学习于折扣 MDP 中的最紧致遗憾下界是什么?
- RQ4能否将遗憾对折扣因子 $\gamma$ 的依赖从 $O((1-\gamma)^{-2.5})$ 改进至 $O((1-\gamma)^{-1.5})$?
主要发现
- 所提出的 UCBVI-γ 算法在折扣 MDP 中实现了上界遗憾 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{1.5})$。
- 本文构建了一类困难的 MDP,其期望遗憾的下界为 $\widetilde{\Omega}(\sqrt{SAT}/(1-\gamma)^{1.5})$。
- 上下界在对数因子范围内匹配,证实 UCBVI-γ 几乎达到极小极大最优。
- 该遗憾界优于先前工作(如双 Q-learning [15]),后者遗憾界为 $\widetilde{O}(\sqrt{SAT}/(1-\gamma)^{2.5})$。
- 在表格设置中,该算法优于基于线性混合 MDP 的方法,避免了由通用特征映射引起的 $S^2A$ 依赖。
- 分析表明,改进的 Bernstein 奖励项和基于方差的置信区间在实现改进的遗憾尺度中起着关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。