[论文解读] Oracle-Efficient Regret Minimization in Factored MDPs with Unknown Structure
该论文提出了首个针对未知结构的分解MDP(FMDP)的oracle高效后悔最小化算法,结合了不确定性下的乐观性与统计范围学习。该算法实现了接近最优的$√{T}$后悔,其规模随FMDP编码呈多项式增长,即使规划器oracle仅提供非分解动作,仍能保持高效,并建立了与当前最优上界匹配的新极小极大下界。
We study regret minimization in non-episodic factored Markov decision processes (FMDPs), where all existing algorithms make the strong assumption that the factored structure of the FMDP is known to the learner in advance. In this paper, we provide the first algorithm that learns the structure of the FMDP while minimizing the regret. Our algorithm is based on the optimism in face of uncertainty principle, combined with a simple statistical method for structure learning, and can be implemented efficiently given oracle-access to an FMDP planner. Moreover, we give a variant of our algorithm that remains efficient even when the oracle is limited to non-factored actions, which is the case with almost all existing approximate planners. Finally, we leverage our techniques to prove a novel lower bound for the known structure case, closing the gap to the regret bound of Chen et al. [2021].
研究动机与目标
- 解决非回合制分解MDP中,当学习者未知分解结构时的后悔最小化这一开放问题。
- 设计一种算法,在通过FMDP规划器oracle实现计算效率的同时,学习FMDP结构。
- 将框架扩展至适用于非分解动作oracle,这在现有近似规划器中很常见。
- 为具有已知结构的FMDP建立新的极小极大下界,填补与最佳已知上界之间的差距。
提出的方法
- 引入一致范围的概念,并利用统计检验在学习过程中剔除不一致的范围。
- 采用面对不确定性时的乐观原则,指导在结构不确定情况下的探索与策略选择。
- 基于候选一致范围构建乐观MDP,并利用FMDP规划器oracle计算策略。
- 在不增加计算复杂度的前提下,将结构学习整合进后悔最小化循环,仅依赖于oracle访问。
- 通过修改规划与探索组件,使算法能够适应非分解动作oracle。
- 利用该算法框架推导出新下界,揭示了后悔对范围大小$m$的指数依赖关系,以及对因子数$d$的$√{d}$依赖关系。
实验结果
研究问题
- RQ1当学习者未知底层结构时,是否可以在保持oracle效率的前提下实现分解MDP中的后悔最小化?
- RQ2如何在不引入指数级计算成本的前提下,将结构学习整合进乐观后悔最小化框架?
- RQ3当规划oracle仅支持非分解动作时,是否仍能保持近似最优的后悔界?
- RQ4具有已知结构的分解MDP中,后悔的极小极大下界是什么?是否与最佳已知上界匹配?
- RQ5结构学习过程是否受益于部分领域知识?能否高效地将其整合进算法?
主要发现
- 所提出的SLF-UCRL算法实现了接近最优的$\sqrt{T}$后悔规模,相较于表格型MDP的后悔界呈指数级更小。
- 即使规划器oracle返回非分解动作,该算法仍保持oracle效率,从而与现有近似规划器兼容。
- 在SysAdmin领域中的数值实验表明,SLF-UCRL的后悔水平与假设结构完全已知的分解-UCRL算法相当。
- 该算法能随时间成功剔除不一致的范围,展示了实际中有效的结构学习能力。
- 本文建立了有限时域FMDP的全新极小极大下界$\Omega\bigl{(}\sqrt{\frac{d}{\log d}HW^{m}|A|T}\bigr{)}$,与Chen等人[2021]的上界仅相差对数因子。
- 该下界证明了后悔必须随范围大小$m$呈指数级增长,从而解决了该领域的一个关键开放问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。