[论文解读] Exponential Lower Bounds for Planning in MDPs With Linearly-Realizable Optimal Action-Value Functions
本文建立了在固定时域和折扣型马尔可夫决策过程(MDPs)中规划的指数级查询复杂度下界,这些 MDP 的最优动作值函数具有线性可实现性。尽管假设最优 Q 函数位于 d 维特征映射的张成空间中,本文证明任何可靠规划器在固定时域情况下必须进行至少 min(e^Ω(d), Ω(2^H)) 次查询,在折扣型情况下必须进行 e^Ω(d) 次查询,表明仅靠可实现性本身不足以实现查询高效的规划。
We consider the problem of local planning in fixed-horizon and discounted Markov Decision Processes (MDPs) with linear function approximation and a generative model under the assumption that the optimal action-value function lies in the span of a feature map that is available to the planner. Previous work has left open the question of whether there exist sound planners that need only poly(H,d) queries regardless of the MDP, where H is the horizon and d is the dimensionality of the features. We answer this question in the negative: we show that any sound planner must query at least $\min(\exp(Ω(d)), Ω(2^H))$ samples in the fized-horizon setting and $\exp(Ω(d))$ samples in the discounted setting. We also show that for any $δ>0$, the least-squares value iteration algorithm with $O(H^5d^{H+1}/δ^2)$ queries can compute a $δ$-optimal policy in the fixed-horizon setting. We discuss implications and remaining open questions.
研究动机与目标
- 解决最优动作值函数的可实现性是否足以保证在具有线性函数逼近的 MDP 中实现查询高效的规划。
- 在已知特征映射下,最优 Q 函数线性可实现的假设下,确定可靠规划器的最坏情况查询复杂度。
- 为固定时域和折扣型 MDP 中规划所需的模拟器查询次数建立紧致的下界。
- 将 q*-可实现性下的规划查询复杂度与其他可实现性假设进行对比,特别是在动作空间较大的情形下。
提出的方法
- 利用 Johnson-Lindenstrauss 引理生成近正交的特征向量,构建一个具有指数级多动作的确定性 MDP 家族。
- 设计一种奖励结构,使得在最终时间步,最优动作与其他动作之间的差距为指数级微小,该差距通过时域向后传播被放大。
- 使用反向归纳法和集中不等式(Hoeffding 不等式)来界定在生成模型下值函数逼近中的估计误差。
- 在固定时域设置中,应用具有样本复杂度 Õ(H^5 d^{H+1} / δ^2) 的最小二乘值迭代算法,以获得 δ-最优策略。
- 采用递归误差传播论证,以界定每一阶段估计值函数与真实最优值函数之间的差异。
- 通过归约证明下界:任何规划器必须对 d 或 H 进行指数级查询,才能区分几乎相同的值函数。
实验结果
研究问题
- RQ1最优动作值函数的可实现性是否足以保证在具有线性函数逼近的 MDP 中实现查询高效的规划?
- RQ2当最优 Q 函数线性可实现时,可靠规划器在固定时域 MDP 中的最坏情况查询复杂度是多少?
- RQ3在 q*-可实现性下,查询复杂度如何随特征维数 d 和规划时域 H 变化?
- RQ4在相同的可实现性假设下,指数级查询复杂度是否仍存在于折扣型 MDP 设置中?
- RQ5该设定下已知的上界与下界之间的差距能否被缩小?
主要发现
- 在固定时域设置中,任何可靠规划器必须至少进行 min(e^Ω(d), Ω(2^H)) 次查询,表明查询复杂度可能在 d 或 H 上呈指数级增长。
- 在折扣型 MDP 设置中,查询复杂度至少为 e^Ω(d),表明其对特征维数具有指数依赖性。
- 具有 Õ(H^5 d^{H+1} / δ^2) 查询次数的最小二乘值迭代算法可在固定时域设置中计算出 δ-最优策略。
- 下界构造除最终时间步的随机奖励外均为确定性,突显了与仅可能选择 d 个次优动作的确定性 MDP 的鲜明对比。
- 指数级下界并非仅源于动作空间的大小,而是源于在可实现性假设下值函数逼近的结构,即使动作集很大也是如此。
- 结果表明,q*-可实现性与其他可实现性假设(如所有无记忆策略的 q^π 可实现性)之间存在显著差异,尤其在 H > 1 时更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。