Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Markov Decision Problems via the Linear Programming Dual

Yasin Abbasi-Yadkori, Peter L. Bartlett|arXiv (Cornell University)|Jan 6, 2019
Reinforcement Learning in Robotics参考文献 27被引用 7
一句话总结

本文提出了一种新颖方法,通过在基于近似占用度量的低维策略族上进行优化,求解大规模马尔可夫决策过程(MDP),该方法基于线性规划的对偶形式。该方法引入了一种高效的随机次梯度算法,其计算复杂度仅依赖于子空间维度而非状态空间大小,在平均成本和折扣成本设置下均实现了可证明的过剩损失边界,并在排队网络应用中得到了实证验证。

ABSTRACT

We consider the problem of controlling a fully specified Markov decision process (MDP), also known as the planning problem, when the state space is very large and calculating the optimal policy is intractable. Instead, we pursue the more modest goal of optimizing over some small family of policies. Specifically, we show that the family of policies associated with a low-dimensional approximation of occupancy measures yields a tractable optimization. Moreover, we propose an efficient algorithm, scaling with the size of the subspace but not the state space, that is able to find a policy with low excess loss relative to the best policy in this class. To the best of our knowledge, such results did not exist in the literature previously. We bound excess loss in the average cost and discounted cost cases, which are treated separately. Preliminary experiments show the effectiveness of the proposed algorithms in a queueing application.

研究动机与目标

  • 解决当状态空间过大、标准动态规划或线性规划方法无法处理时,大规模MDP求解的不可行性问题。
  • 构建一种可计算的优化框架,其复杂度依赖于低维策略类而非完整状态空间。
  • 为平均成本和折扣成本MDP中的参数化策略类,提供相对于其中最优策略的理论过剩损失边界。
  • 设计一种算法,避免依赖于最优策略分布的样本,与以往的近似线性规划(ALP)方法形成对比。
  • 通过在特征维度降低10,000倍的排队网络实验中,验证方法在实际应用中的有效性。

提出的方法

  • 通过线性规划的对偶形式构建MDP规划问题,聚焦于占用度量及其通过特征矩阵Φ的低维近似。
  • 在对偶空间中通过线性函数参数化策略,实现对低维策略子空间的优化。
  • 使用随机次梯度下降最小化一个代理损失函数,该函数结合了对偶LP的目标函数与约束违反项。
  • 提出一种随机化算法,动态采样约束条件,通过仅依赖于子空间维度,实现对大规模状态空间的可扩展性。
  • 利用对偶LP的结构,通过新颖的证明技术,推导出在平均成本与折扣成本设置下的过剩损失边界。
  • 引入反向模拟器,以访问任意给定状态的前驱状态,从而支持约束采样与策略评估。

实验结果

研究问题

  • RQ1当在低维策略类上进行优化时,能否为大规模MDP实现可证明的过剩损失边界?
  • RQ2能否设计一种算法,其复杂度依赖于子空间维度而非完整状态空间大小,以实现MDP规划的可扩展性?
  • RQ3如何利用对偶LP形式,在平均成本与折扣成本MDP设置下推导出理论性能保证?
  • RQ4能否避免依赖于最优策略分布样本(如以往ALP方法所依赖的),同时仍保持收敛性与误差边界?
  • RQ5与现实世界应用中常见的启发式策略相比,该方法在实际应用(如排队网络)中的有效性如何?

主要发现

  • 所提算法在平均成本与折扣成本MDP中,相对于参数化策略类中的最优策略,均实现了可证明的过剩损失边界,且边界通过新颖的证明技术推导得出。
  • 该方法的计算复杂度仅依赖于策略子空间的维度,而非状态空间的大小,从而在大规模问题中实现高效计算。
  • 在包含372个特征(相比原始状态空间减少10^4倍)的排队网络中,该算法在平均损失方面优于两种常见启发式策略(LONGER与LBFS)。
  • 随机次梯度下降算法成功最小化了代理损失函数,如图5右图所示,导致更低的平均损失。
  • 该方法与以往ALP方法存在根本性差异,其不基于值函数,而是基于平稳分布,从而推动了新的理论与算法发展。
  • 实证结果证实,最小化代理损失函数可产生实际平均损失更低的策略,验证了理论框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。