Skip to main content
QUICK REVIEW

[论文解读] Randomized Linear Programming Solves the Discounted Markov Decision Problem In Nearly-Linear Running Time.

Mengdi Wang|arXiv (Cornell University)|Apr 6, 2017
Reinforcement Learning in Robotics被引用 15
一句话总结

该论文提出了一种随机化线性规划算法,利用价值-策略对偶性并自适应采样状态转移,以近乎线性时间求解折扣率马尔可夫决策过程(MDP)。对于遍历性MDP,该算法以与状态动作对数量线性相关的运行时间实现$\epsilon$-最优策略,为随机动态规划提供了输入规模的次线性复杂度基准。

ABSTRACT

We propose a randomized linear programming algorithm for approximating the optimal policy of the discounted Markov decision problem. By leveraging the value-policy duality, the algorithm adaptively samples state transitions and makes exponentiated primal-dual updates. We show that it finds an $\epsilon$-optimal policy using nearly-linear running time in the worst case. For Markov decision processes that are ergodic under every stationary policy, we show that the algorithm finds an $\epsilon$-optimal policy using running time linear in the total number of state-action pairs, which is sublinear in the input size. These results provide new complexity benchmarks for solving stochastic dynamic programs.

研究动机与目标

  • 开发一种可扩展的算法,用于求解折扣率马尔可夫决策过程(MDP),并改进运行时间复杂度。
  • 利用价值-策略对偶性设计一种自适应采样状态转移的随机化线性规划方法。
  • 为一般MDP中寻找$\epsilon$-最优策略建立近乎线性的时间复杂度。
  • 对于遍历性MDP,实现运行时间与状态动作对数量的线性关系,输入规模的次线性依赖。
  • 为随机动态规划提供新的复杂度基准。

提出的方法

  • 利用价值-策略对偶性将MDP重新表述为线性规划问题。
  • 基于当前策略估计值自适应采样状态转移,以降低计算开销。
  • 应用指数型原始-对偶更新,迭代改进策略与价值函数估计。
  • 采样策略确保以高概率收敛至$\epsilon$-最优策略。
  • 方法根据对偶间隙和策略改进标准动态调整探索策略。
  • 利用浓度不等式和基于对偶性的误差控制来界定运行时间。

实验结果

研究问题

  • RQ1随机化线性规划方法能否在近乎线性时间内求解折扣率MDP?
  • RQ2对状态转移的自适应采样如何影响收敛性和运行时间?
  • RQ3在平稳策略下,该算法在遍历性MDP中的运行时间复杂度是多少?
  • RQ4该算法能否在状态动作对数量上实现输入规模的次线性依赖?
  • RQ5该方法为随机动态规划建立了哪些理论复杂度基准?

主要发现

  • 该算法在最坏情况下以近乎线性的时间复杂度找到$\epsilon$-最优策略。
  • 对于遍历性MDP,运行时间与状态动作对总数呈线性关系,输入规模的次线性依赖。
  • 该方法通过结合自适应采样与指数型原始-对偶更新实现高效性。
  • 运行时间复杂度优于先前方法,避免了对状态空间的完整枚举。
  • 该算法为求解随机动态规划建立了新的复杂度基准。
  • 理论分析证实了高概率收敛性,并对对偶间隙的减小提供了紧致界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。