Skip to main content
QUICK REVIEW

[论文解读] An Empirical Dynamic Programming Algorithm for Continuous MDPs

William B. Haskell, Rahul Jain|arXiv (Cornell University)|Sep 21, 2017
Reinforcement Learning in Robotics参考文献 29被引用 4
一句话总结

该论文提出了一种适用于连续状态马尔可夫决策过程的通用经验动态规划算法,采用随机函数逼近和经验贝尔曼更新。通过结合参数化与非参数化函数空间——具体为随机参数化基函数和再生核希尔伯特空间(RKHS)——并结合基于样本的值迭代方法,该方法在无需问题特定基函数选择的情况下,实现了非渐近样本复杂度边界和收敛性保证。

ABSTRACT

We propose universal randomized function approximation-based empirical value iteration (EVI) algorithms for Markov decision processes. The `empirical' nature comes from each iteration being done empirically from samples available from simulations of the next state. This makes the Bellman operator a random operator. A parametric and a non-parametric method for function approximation using a parametric function space and the Reproducing Kernel Hilbert Space (RKHS) respectively are then combined with EVI. Both function spaces have the universal function approximation property. Basis functions are picked randomly. Convergence analysis is done using a random operator framework with techniques from the theory of stochastic dominance. Finite time sample complexity bounds are derived for both universal approximate dynamic programming algorithms. Numerical experiments support the versatility and effectiveness of this approach.

研究动机与目标

  • 解决连续状态 MDP 中缺乏通用近似动态规划(ADP)方法的问题,这些方法无需依赖领域特定的基函数选择。
  • 开发计算上可行且易于实现的 ADP 算法,同时在不依赖先验问题知识的情况下保持理论性能保证。
  • 为使用随机算子框架的连续状态 MDP 中值函数逼近提供非渐近样本复杂度边界。
  • 通过将随机支配技术应用于迭代随机算子,实现收敛性分析,确保鲁棒性和可计算性。
  • 在如倒立摆和 Acrobot 等基准控制问题上展示方法的实验有效性,且超参数调优极少。

提出的方法

  • 使用经验值学习(EVL),其中每个贝尔曼更新均基于采样的下一状态转移计算,将贝尔曼算子转化为随机算子。
  • 对于参数化方法,在每次迭代中随机采样基函数的参数(例如,傅里叶特征),并通过凸优化进行拟合。
  • 对于非参数化方法,使用高斯核在 RKHS 中从随机采样的状态生成基函数,实现在上确界范数下的通用逼近。
  • 应用随机算子框架并结合随机支配分析收敛性,实现非渐近样本复杂度边界。
  • 将随机函数逼近与经验贝尔曼更新相结合,降低计算成本并缓解维度灾难问题。
  • 利用标准 Python 库进行函数拟合,确保实现简单性并兼容现有优化工具。

实验结果

研究问题

  • RQ1能否为连续状态 MDP 设计一种不依赖人工挑选基函数的通用 ADP 算法?
  • RQ2能否为采用随机函数逼近的经验动态规划推导出非渐近样本复杂度边界?
  • RQ3在收敛速度和计算效率方面,随机参数化与非参数化函数逼近方法有何差异?
  • RQ4所提方法能否在不依赖值函数光滑或规则性假设的前提下,实现上确界范数误差保证?
  • RQ5在一般条件下,采用随机基函数的经验贝尔曼更新是否能保持稳定性和收敛性?

主要发现

  • 在倒立摆问题中,EVL+RPBF 方法优于拟合值迭代(FVI)和 EVL+RKHS,实现了更高的平均回合长度和更快的学习速度。
  • EVL+RKHS 是唯一提供上确界范数误差保证的算法,而 EVL+RPBF 提供了 Lp 范数误差保证且显著更快,在 Acrobot 任务中平均每次迭代节省 3.67 分钟。
  • 在 Acrobot 问题中,EVL+RPBF 在性能和收敛速度上均优于 EVL+RKHS,展示了误差范数保证与计算效率之间的权衡。
  • 所提算法通过随机算子框架实现了非渐近样本复杂度边界,从而在不依赖随机李雅普诺夫方法的前提下,提供了理论性能保证。
  • 数值实验验证了该方法在不同 MDP 中的计算可行性与通用性,包括具有非光滑或不规则值函数的 MDP。
  • 该方法的通用性源于使用具备通用逼近性质的函数空间——参数化族和 RKHS——确保对任意连续值函数均可实现任意精度逼近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。