Skip to main content
QUICK REVIEW

[论文解读] Efficient Planning in Large MDPs with Weak Linear Function Approximation

Roshan Shariff, Csaba Szepesvári|arXiv (Cornell University)|Jul 13, 2020
Reinforcement Learning in Robotics参考文献 41被引用 9
一句话总结

本文提出了一种针对大规模马尔可夫决策过程(MDPs)的随机规划算法,采用弱线性函数逼近,仅需最优值函数能被特征良好逼近。通过利用一组特征能覆盖所有状态特征的小型核心状态集,该算法在使用生成模型查询时,实现了多项式时间计算与近似最优性能,解决了弱特征下高效规划的一个开放问题。

ABSTRACT

Large-scale Markov decision processes (MDPs) require planning algorithms with runtime independent of the number of states of the MDP. We consider the planning problem in MDPs using linear value function approximation with only weak requirements: low approximation error for the optimal value function, and a small set of "core" states whose features span those of other states. In particular, we make no assumptions about the representability of policies or value functions of non-optimal policies. Our algorithm produces almost-optimal actions for any state using a generative oracle (simulator) for the MDP, while its computation time scales polynomially with the number of features, core states, and actions and the effective horizon.

研究动机与目标

  • 解决在仅最优值函数能被特征良好逼近(弱特征)时,大规模MDP中高效规划的开放问题,而非所有策略的值函数均需可表示。
  • 设计一种规划算法,其运行时间与查询复杂度在特征数、核心状态数、动作数和有效时域上呈多项式增长,且与完整状态空间大小无关。
  • 在不依赖非最优策略或值函数强表示性假设的前提下,实现策略性能的近似最优。
  • 通过引入具有收敛性保证的随机对偶点求解器,弥合理论线性规划方法与实际高效规划之间的差距。

提出的方法

  • 该算法使用一种松弛的近似线性规划(ALP),仅在预设的小型核心状态集上强制执行贝尔曼约束,而非所有状态。
  • 将规划问题建模为策略与值函数参数之间的凸-凹对偶点问题,从而通过随机一阶方法实现高效优化。
  • 采用精心构造的距离生成函数的随机对偶点求解器,确保收敛至近似解,且对偶间隙有界。
  • 该方法依赖于使用指数权重的对策略与值函数空间的邻近投影,确保在所选范数下具有稳定性和收敛性。
  • 通过与生成模型(模拟器)交互,估计贝尔曼更新与梯度,从而最小化对状态空间的依赖。
  • 理论分析表明,所得策略为 O(ε + cε_approx)-最优,其中 ε 为逼近误差,c 为依赖于 γ、d 与 A 的因子。

实验结果

研究问题

  • RQ1当仅最优值函数能被线性特征良好逼近(弱特征)时,是否可在大规模MDP中实现高效规划,而无需对非最优策略的可表示性提出要求?
  • RQ2是否可设计一种规划算法,其运行时间与查询复杂度在特征数、核心状态数、动作数与有效时域上呈多项式增长,同时保持近似最优性?
  • RQ3如何高效求解仅在核心状态上受约束的松弛ALP形式,以获得近似最优策略?
  • RQ4使用随机对偶点求解器对规划算法的计算效率与收敛性保证有何影响?
  • RQ5在弱特征假设下,最优值函数的逼近误差是否可有效有界,并转化为策略性能保证?

主要发现

  • 所提算法实现 O(ε + cε_approx)-最优策略,其中 ε 为逼近误差,c 为依赖于折扣因子 γ、特征数 d 与动作数 A 的因子。
  • 查询复杂度与运行时间在特征数、核心状态数、动作数与有效时域 H = 1/(1−γ) 上呈多项式增长,且与完整状态空间大小无关。
  • 该算法采用随机对偶点求解器,相比先前方法降低了计算成本,使大规模MDP中的实际部署成为可能。
  • 对偶间隙的理论界保证了由解导出的策略为近似最优,且该间隙在 T 次迭代后以 O(1/√T) 速率衰减。
  • 该方法在弱特征假设下具有鲁棒性:仅需最优值函数能被特征的线性组合良好逼近,且所有状态的特征向量位于核心状态特征的凸包内。
  • 距离生成函数与范数构造确保了 1-强凸性与有界直径,从而为随机对偶点方法提供了收敛性保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。