Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Perturbation Algorithms for Batch Off-Policy Search

Raphaël Fonteneau, L. A. Prashanth|arXiv (Cornell University)|Mar 18, 2014
Reinforcement Learning in Robotics参考文献 14被引用 3
一句话总结

本文提出了一种新颖的批量离策略强化学习算法,适用于连续状态和动作空间,采用同时扰动随机逼近(SPSA)和光滑函数(SF)方法来估计代价到目标函数的梯度与海森矩阵。该方法结合了无模型、非参数化的策略评估器(MFMC)与一阶和二阶优化,无需函数逼近器即可实现向最优策略的收敛,已在一维连续控制问题上得到验证。

ABSTRACT

We propose novel policy search algorithms in the context of off-policy, batch mode reinforcement learning (RL) with continuous state and action spaces. Given a batch collection of trajectories, we perform off-line policy evaluation using an algorithm similar to that by [Fonteneau et al., 2010]. Using this Monte-Carlo like policy evaluator, we perform policy search in a class of parameterized policies. We propose both first order policy gradient and second order policy Newton algorithms. All our algorithms incorporate simultaneous perturbation estimates for the gradient as well as the Hessian of the cost-to-go vector, since the latter is unknown and only biased estimates are available. We demonstrate their practicality on a simple 1-dimensional continuous state space problem.

研究动机与目标

  • 解决在无函数逼近器的情况下,连续状态与动作空间中的离策略批量强化学习挑战。
  • 开发利用类似蒙特卡洛的策略评估方法以实现精确的代价到目标估计的策略搜索算法。
  • 提出基于同时扰动的梯度与海森矩阵估计的一阶与二阶优化方法,当闭式表达式不可用时仍可使用。
  • 确保在MFMC估计存在偏差的情况下,策略参数收敛至近似最优解。
  • 在具有理论收敛保证的一维连续控制问题上展示方法的实用性。

提出的方法

  • 提出一种非参数化策略评估方法(MFMC),通过一批轨迹及状态与动作空间上的度量来估计代价到目标。
  • 使用同时扰动随机逼近(SPSA)与光滑函数(SF)技术,估计代价到目标函数的梯度与海森矩阵。
  • 设计一阶策略梯度算法(MCPG-SPSA、MCPG-SF),利用SPSA或SF梯度估计更新策略参数。
  • 开发二阶牛顿型算法(MCPN-SPSA、MCPN-SF),通过引入海森矩阵估计以实现更快收敛。
  • 采用基于投影的更新方法,确保策略参数保持在可行集合内。
  • 在较弱假设下(包括MFMC估计偏差有界)证明算法以概率 1 − η 收敛至渐近稳定平衡点集合。

实验结果

研究问题

  • RQ1在动态未知的情况下,同时扰动方法能否有效用于估计离策略批量强化学习中梯度与海森矩阵?
  • RQ2在连续状态与动作空间中,如何在不使用函数逼近器的情况下进行策略评估?
  • RQ3在MFMC估计存在偏差的情况下,基于SPSA/SF的一阶与二阶策略搜索算法是否能收敛至最优策略?
  • RQ4在无限时域折扣MDP设置下,这些算法的理论收敛行为如何?
  • RQ5所提方法是否能在不依赖值函数逼近器的情况下,实现连续控制问题中的实际性能?

主要发现

  • 所提出的MCPG-SPSA与MCPG-SF算法在MFMC估计器偏差有界时,以概率 1 − η 收敛至渐近稳定平衡点集合。
  • MCPN-SPSA与MCPN-SF算法以概率 1 − η 收敛至牛顿更新ODE的渐近稳定平衡点集合。
  • SPSA-based算法中的海森矩阵估计几乎必然收敛至真实海森矩阵,当 δ → 0 时。
  • 梯度与海森矩阵估计器在极限下具有一致性,偏差随时间渐近趋于零。
  • 该方法在一维连续控制问题上实现了实际性能,证明了无需函数逼近器的可行性。
  • 通过基于ODE的分析建立了理论收敛性,其中代价到目标函数作为严格李雅普诺夫函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。