[论文解读] Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation
该论文提出了三种新颖的算法,用于在使用线性函数逼近的情况下学习无限时域平均奖励马尔可夫决策过程。它提出了FOPO和OLSVI.FH,分别在$;(√{T})$和$˜{ℓ}(T^{3/4})$的遗憾下适用于线性MDP,并提出了受对抗性Bandits启发的MDP-Exp2,在不同假设下实现$˜{ℓ}(√{T})$的遗憾,改进了先前的结果,并与自然策略梯度方法建立了联系。
We develop several new algorithms for learning Markov Decision Processes in an infinite-horizon average-reward setting with linear function approximation. Using the optimism principle and assuming that the MDP has a linear structure, we first propose a computationally inefficient algorithm with optimal $\\widetilde{O}(\\sqrt{T})$ regret and another computationally efficient variant with $\\widetilde{O}(T^{3/4})$ regret, where $T$ is the number of interactions. Next, taking inspiration from adversarial linear bandits, we develop yet another efficient algorithm with $\\widetilde{O}(\\sqrt{T})$ regret under a different set of assumptions, improving the best existing result by Hao et al. (2020) with $\\widetilde{O}(T^{2/3})$ regret. Moreover, we draw a connection between this algorithm and the Natural Policy Gradient algorithm proposed by Kakade (2002), and show that our analysis improves the sample complexity bound recently given by Agarwal et al. (2020).
研究动机与目标
- 解决在使用线性函数逼近时,无限时域平均奖励MDP在强化学习中的理论空白。
- 在满足线性MDP假设的前提下,开发计算高效且具有最优遗憾边界的算法。
- 在平均奖励设置下改进现有遗憾边界,特别是在弱于或不同于先前工作的假设下。
- 建立所提出的MDP-Exp2算法与自然策略梯度方法之间的联系,以增强对样本复杂度的理解。
提出的方法
- 提出FOPO,一种使用非凸约束(类似于LSVI但带有乐观项)的乐观固定点优化算法,依赖于懒惰更新策略以控制遗憾。
- 提出OLSVI.FH,将无限时域问题重新表述为有限时域问题,并应用乐观LSVI,通过将无限时域问题转化为有限时域问题来实现高效计算,但遗憾更高。
- 开发MDP-Exp2,受对抗性线性Bandits(Exp2)启发,其中每个状态使用指数加权更新,并通过重要性加权和轨迹聚合构建近似无偏的奖励估计器。
- 通过$ℓ(1/\sigma)$条轨迹,近似无偏地估计优势函数$A^{\pi_\theta}(x,a)$,其方差被限制在$ℓ(1/\sigma)$以内,确保偏差极小且方差可控。
- 通过证明在相同假设下,MDP-Exp2的更新方向与自然策略梯度(NPG)的策略更新方向一致,从而将MDP-Exp2与自然策略梯度算法建立正式联系。
- 通过$M_k^{-1}$进行重要性加权,以聚合轨迹并减少优势估计器中的偏差,从而实现稳定且高效的学习。
实验结果
研究问题
- RQ1我们能否设计出一种计算高效的算法,在使用线性函数逼近的无限时域平均奖励MDP中实现接近最优的$˜{ℓ}(√{T})$遗憾?
- RQ2在不依赖强假设(如均匀混合性)的前提下,如何在满足线性MDP假设的平均奖励设置下实现低遗憾?
- RQ3在与Hao等人(2021)相似的假设下,能否改进其$˜{ℓ}(T^{2/3})$的遗憾边界?
- RQ4所提出的MDP-Exp2算法与自然策略梯度方法之间存在何种联系?这对样本复杂度有何影响?
主要发现
- 在贝尔曼最优性方程假设下,FOPO以高概率实现$˜{ℓ}(√{dT})$的遗憾,其$T$依赖性达到最优。
- OLSVI.FH通过将无限时域问题转化为有限时域问题,实现了高效的计算,遗憾为$˜{ℓ}((dT)^{3/4})$。
- MDP-Exp2在均匀混合性和均匀激励特征的假设下,实现$˜{ℓ}(√{T})$的遗憾,优于Hao等人(2021)的$˜{ℓ}(T^{2/3})$边界。
- MDP-Exp2的分析改进了Agarwal等人(2020)的样本复杂度边界,实现了$˜{ℓ}(√{T})$的遗憾,而他们的方法仅达到$ℓ(T^{3/4})$的遗憾。
- MDP-Exp2算法的估计器构造仅需$ℓ(1/\sigma)$条轨迹即可实现可忽略的偏差和有界的方差,从而实现高效且稳定的训练。
- 该论文正式建立了MDP-Exp2与自然策略梯度算法之间的联系,证明在相同假设下,其更新方向与NPG的策略改进步骤一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。