Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting

Ziping Xu, Ambuj Tewari|arXiv (Cornell University)|Feb 6, 2020
Reinforcement Learning in Robotics参考文献 32被引用 5
一句话总结

本文提出了一种针对因子化马尔可夫决策过程(FMDPs)的Oracle高效强化学习算法,通过引入一种新型连通性度量——因子跨度(factored span),实现了更紧致的遗憾边界。所提出的DORL与PSRL算法在非回合制设置下实现了近似最优的遗憾边界,当特化到标准MDP时,其性能与标准MDP的最优表现一致;而FSRL算法则通过利用因子跨度而非直径,缩小了上界与下界遗憾之间的差距。

ABSTRACT

We study reinforcement learning in non-episodic factored Markov decision processes (FMDPs). We propose two near-optimal and oracle-efficient algorithms for FMDPs. Assuming oracle access to an FMDP planner, they enjoy a Bayesian and a frequentist regret bound respectively, both of which reduce to the near-optimal bound $\widetilde{O}(DS\sqrt{AT})$ for standard non-factored MDPs. We propose a tighter connectivity measure, factored span, for FMDPs and prove a lower bound that depends on the factored span rather than the diameter $D$. In order to decrease the gap between lower and upper bounds, we propose an adaptation of the REGAL.C algorithm whose regret bound depends on the factored span. Our oracle-efficient algorithms outperform previously proposed near-optimal algorithms on computer network administration simulations.

研究动机与目标

  • 设计适用于非回合制因子化MDP的Oracle高效算法,通过多项式次数调用FMDP规划器Oracle。
  • 通过用更紧致的、针对因子化结构的连通性度量替代标准直径,改进FMDPs中的遗憾边界。
  • 通过一种新的算法适应方式,缩小FMDPs中现有上界与下界遗憾之间的差距。
  • 在真实世界模拟中验证所提算法的性能,特别是在计算机网络管理中的应用。

提出的方法

  • 提出DORL与PSRL算法,利用FMDP规划器Oracle,在非回合制设置下实现近似最优的遗憾边界。
  • 引入“因子跨度”作为FMDPs的更紧致连通性度量,替代遗憾分析中的传统直径。
  • 将REGAL.C算法改进为FSRL,使其遗憾边界依赖于因子跨度而非直径。
  • 证明了依赖于因子跨度的遗憾下界,证明其在FMDP情境下的最优性。
  • 使用动态贝叶斯网络紧凑表示FMDP转移函数,并通过Oracle访问实现高效规划。
  • 利用偏差向量跨度与各因子间的奖励分解,推导出值函数差异的更紧致边界。

实验结果

研究问题

  • RQ1能否为非回合制FMDPs设计出Oracle高效算法,实现近似最优遗憾,且Oracle调用次数为多项式级别?
  • RQ2在FMDPs中,因子跨度度量是否能提供比标准直径更紧致的遗憾边界?
  • RQ3通过用因子跨度替代直径,能否缩小FMDPs中上界与下界遗憾之间的差距?
  • RQ4在计算机网络管理等实际大规模场景中,所提算法的性能如何?

主要发现

  • DORL与PSRL算法在频率学与贝叶斯框架下的遗憾边界均为$\widetilde{O}(DS\sqrt{AT})$量级,当特化到标准MDP时,与标准MDP的最佳已知边界一致。
  • 因子跨度度量被证明是比直径更紧致的连通性指标,其遗憾下界依赖于因子跨度而非直径。
  • FSRL算法通过依赖因子跨度,缩小了遗憾边界差距,同时改善了对直径和因子数量$m$的依赖关系。
  • 在计算机网络管理模拟中,所提算法优于先前的近似最优算法,展现出实际效率。
  • 理论分析证明,遗憾下界与因子跨度成比例,且上界与之匹配,证实了该新度量的紧致性。
  • 在结构化FMDPs中,使用因子跨度相比基于直径的边界,可将上界改进约$1/m$倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。