Skip to main content
QUICK REVIEW

[论文解读] Online Reinforcement Learning of Optimal Threshold Policies for Markov Decision Processes

Arghyadip Roy, Vivek S. Borkar|arXiv (Cornell University)|Dec 21, 2019
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出SALMUT,一种结构感知的在线强化学习算法,利用马尔可夫决策过程(MDP)中最优策略的有序多阈值结构。通过采用双时标随机逼近方案仅学习阈值参数,SALMUT相比经典强化学习方法实现了更快的收敛速度,并降低了计算与存储复杂度。理论上证明了其渐近收敛至最优策略,仿真结果亦加以验证。

ABSTRACT

To overcome the curses of dimensionality and modeling of Dynamic Programming (DP) methods to solve Markov Decision Process (MDP) problems, Reinforcement Learning (RL) methods are adopted in practice. Contrary to traditional RL algorithms which do not consider the structural properties of the optimal policy, we propose a structure-aware learning algorithm to exploit the ordered multi-threshold structure of the optimal policy, if any. We prove the asymptotic convergence of the proposed algorithm to the optimal policy. Due to the reduction in the policy space, the proposed algorithm provides remarkable improvements in storage and computational complexities over classical RL algorithms. Simulation results establish that the proposed algorithm converges faster than other RL algorithms.

研究动机与目标

  • 通过利用最优策略的结构性质,解决动态规划中维度灾难与建模问题。
  • 通过仅关注有序多阈值策略,缩小策略搜索空间,从而提升计算与存储效率。
  • 开发一种在线学习算法,渐近收敛至最优阈值策略,且无需预先知晓转移概率。
  • 通过理论分析与仿真,证明其收敛速度优于经典强化学习算法,且复杂度更低。

提出的方法

  • 该算法采用双时标随机逼近框架,在快速时标上更新价值函数,在慢速时标上更新阈值参数。
  • 利用同时扰动随机逼近方法,基于阈值参数对平均奖励的梯度估计来更新阈值参数。
  • 通过强制价值函数差值的单调性,确保学习过程中保持阈值结构。
  • 利用平均奖励关于阈值参数的单峰性质,实现高效的基于梯度的优化。
  • 通过仅学习阈值参数而非所有状态-动作对的完整价值函数,避免全策略枚举,显著缩小搜索空间。
  • 通过采样转移数据,迭代执行策略评估与改进,价值函数更新基于采样得到的奖励与状态转移。

实验结果

研究问题

  • RQ1能否通过利用最优策略已知的多阈值结构,在MDP的在线强化学习中实现更快收敛?
  • RQ2如何在保持渐近收敛至最优策略的前提下,有效缩小策略搜索空间?
  • RQ3与经典强化学习算法相比,结构感知学习对计算与存储复杂度有何影响?
  • RQ4在存在采样噪声的情况下,基于梯度的阈值更新是否能实现稳定且收敛的学习?
  • RQ5能否利用平均奖励关于阈值参数的单峰性质,设计出高效的在线学习算法?

主要发现

  • 在步长与采样标准假设下,SALMUT算法渐近收敛至最优阈值策略。
  • 由于策略搜索空间缩小,SALMUT的收敛速度优于经典Q-learning与基于PDS的方法。
  • 通过仅学习阈值参数而非所有状态-动作对的完整价值函数,显著降低了存储与计算复杂度。
  • 已证明平均奖励关于每个阈值参数呈单峰性,从而支持高效的基于梯度的优化。
  • 仿真结果表明,在具有多个客户类别的有限缓冲多服务器队列中,SALMUT的收敛速度优于基线强化学习算法。
  • 该方法在整个学习过程中保持结构一致性(如价值函数差值的单调性),确保所有迭代中阈值策略始终有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。