[论文解读] Lower Bound On the Computational Complexity of Discounted Markov Decision Problems
本文建立了有限状态和动作空间的无限时域折扣马尔可夫决策过程(MDP)求解的首个计算复杂度下界。证明了在标准输入表示下,任何随机化算法求解 ϵ-最优策略均需 Ω(|S|²|A|) 时间;当输入以累积数组或二叉树等高效数据结构存储时,时间复杂度下界降低至 Ω(|S||A|/ϵ),揭示输入结构对计算复杂度具有决定性影响。
We study the computational complexity of the infinite-horizon discounted-reward Markov Decision Problem (MDP) with a finite state space $|\mathcal{S}|$ and a finite action space $|\mathcal{A}|$. We show that any randomized algorithm needs a running time at least $Ω(|\mathcal{S}|^2|\mathcal{A}|)$ to compute an $ε$-optimal policy with high probability. We consider two variants of the MDP where the input is given in specific data structures, including arrays of cumulative probabilities and binary trees of transition probabilities. For these cases, we show that the complexity lower bound reduces to $Ω\left( \frac{|\mathcal{S}| |\mathcal{A}|}ε ight)$. These results reveal a surprising observation that the computational complexity of the MDP depends on the data structure of input.
研究动机与目标
- 建立有限状态和动作空间的无限时域折扣MDP求解的首个计算复杂度下界。
- 分析输入数据结构(如累积概率数组、二叉树)的选择如何影响MDP算法的运行时间。
- 探究在有利的输入表示下,MDP是否存在亚线性时间算法。
- 阐明输入数据结构与序列决策问题中计算复杂度之间的关系。
- 为设计更高效的强化学习与动态规划算法提供基础洞见。
提出的方法
- 通过从矩阵微分问题(MDP)的归约,推导MDP求解器的查询复杂度下界。
- 构造MDP的困难实例,其中策略仅在单个转移上不同,迫使算法通过查询来区分它们。
- 应用最小最大原理与概率分析,界定以高概率识别 ϵ-最优策略所需的查询数量。
- 设计一个模拟算法(µ′),模拟确定性MDP求解器的行为,并将其映射到矩阵微分查询。
- 在两种输入格式下分析查询复杂度:标准数组与结构化数据(累积和、二叉树),表明后者复杂度更低。
- 运用组合论证与可区分MDP实例对的数量计数,推导出运行时间的渐近下界。
实验结果
研究问题
- RQ1在高概率下,求解折扣MDP的 ϵ-最优策略所需的最少查询次数是多少?
- RQ2输入数据结构(如数组与二叉树)如何影响MDP求解的计算复杂度?
- RQ3当输入以累积概率数组等高效数据结构存储时,MDP是否存在亚线性时间算法?
- RQ4MDP中是否存在输入表示与算法效率之间的根本权衡?
- RQ5能否高效采样转移是否与MDP求解的计算复杂度降低相关?
主要发现
- 在标准输入表示下,任何随机化算法求解 ϵ-最优策略的运行时间至少为 Ω(|S|²|A|),且成功概率不低于 9/10。
- 当输入存储在累积概率数组或二叉树中时,下界降低至 Ω(|S||A|/ϵ),表明复杂度显著降低。
- 下界对输入数据结构极为敏感,表明算法效率并非仅取决于问题规模。
- 结果揭示MDP复杂度对输入表示存在出人意料的依赖,结构化输入可实现潜在的亚线性运行时间。
- 与已知上界相比,下界在结构化输入下紧致至对数因子,表明其紧致性。
- 研究结果提示策略估计的样本复杂度与MDP求解的计算复杂度之间存在深层联系,但其确切关系尚不明确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。