Skip to main content
QUICK REVIEW

[论文解读] A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes

Honghao Wei, Xin Liu|arXiv (Cornell University)|Jun 3, 2021
Reinforcement Learning in Robotics参考文献 33被引用 6
一句话总结

该论文提出Triple-Q,这是首个无需环境模型、无需仿真器的约束马尔可夫决策过程(CMDP)的强化学习算法,具有可证明的次线性遗憾和零约束违规。它使用三个组件——奖励Q值、约束效用Q值和累积违规的虚拟队列——通过伪Q值组合,平衡探索与安全,实现$\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$的遗憾,且在$K$较大时实现精确的约束满足。

ABSTRACT

This paper presents the first model-free, simulator-free reinforcement learning algorithm for Constrained Markov Decision Processes (CMDPs) with sublinear regret and zero constraint violation. The algorithm is named Triple-Q because it includes three key components: a Q-function (also called action-value function) for the cumulative reward, a Q-function for the cumulative utility for the constraint, and a virtual-Queue that (over)-estimates the cumulative constraint violation. Under Triple-Q, at each step, an action is chosen based on the pseudo-Q-value that is a combination of the three "Q" values. The algorithm updates the reward and utility Q-values with learning rates that depend on the visit counts to the corresponding (state, action) pairs and are periodically reset. In the episodic CMDP setting, Triple-Q achieves $ ilde{\cal O}\left(\frac{1 }δH^4 S^{\frac{1}{2}}A^{\frac{1}{2}}K^{\frac{4}{5}} ight)$ regret, where $K$ is the total number of episodes, $H$ is the number of steps in each episode, $S$ is the number of states, $A$ is the number of actions, and $δ$ is Slater's constant. Furthermore, Triple-Q guarantees zero constraint violation, both on expectation and with a high probability, when $K$ is sufficiently large. Finally, the computational complexity of Triple-Q is similar to SARSA for unconstrained MDPs and is computationally efficient.

研究动机与目标

  • 解决当前缺乏针对CMDP的、具有强理论保证的无模型、无仿真器强化学习算法的问题。
  • 在现实应用中实现安全强化学习,其中必须严格遵守碰撞规避或预算限制等约束。
  • 在不依赖环境仿真器或已知模型的前提下,实现次线性遗憾和零约束违规。
  • 设计一种计算高效的算法,可扩展至使用神经网络的深度强化学习。
  • 为单约束和多约束CMDP提供一个统一优化结构的可证明高效框架。

提出的方法

  • 提出Triple-Q,一种用于阶段式CMDP的无模型算法,维护三个组件:奖励Q函数$Q_h(x,a)$、约束效用Q函数$C_h(x,a)$,以及一个虚拟队列$Z$,用于高估累积约束违规。
  • 在每一步,智能体通过最大化伪Q值选择动作:$\arg\max_a \big(Q_h(x,a) + \frac{Z}{\eta} C_h(x,a)\big)$,其中$\eta$为常数,用于调节约束惩罚的尺度。
  • 使用基于UCB的探索策略,学习率和奖励项依赖于状态-动作对的访问次数,并在每个阶段帧开始时定期重置学习率。
  • 使用随访问次数衰减的时间可变学习率,通过时序差分学习更新奖励和效用Q函数。
  • 缓慢更新虚拟队列$Z$,以跟踪并惩罚约束违规,确保长期约束的遵守。
  • 通过Deep Triple-Q将算法扩展至深度强化学习,采用共享超参数的演员-评论家网络,并周期性地更新虚拟队列。

实验结果

研究问题

  • RQ1无模型、无仿真器的强化学习算法是否能在阶段式CMDP中实现次线性遗憾?
  • RQ2是否可能在不依赖仿真器的前提下,保证在期望和高概率下实现零约束违规?
  • RQ3如何仅通过在线交互,在CMDP中维持安全的探索-利用权衡?
  • RQ4能否通过函数逼近将该算法高效扩展至连续状态和动作空间?
  • RQ5与先前方法相比,虚拟队列与双Q函数的结合如何提升约束处理能力?

主要发现

  • Triple-Q实现了$\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$的遗憾,该遗憾在阶段数$K$上为次线性,显式依赖于时域$H$、状态空间大小$S$、动作空间大小$A$以及Slater常数$\delta$。
  • 当$K$足够大时,该算法在期望和高概率下均保证零约束违规,相比先前允许有界违规的方法有显著改进。
  • 在表格型网格世界环境中,Triple-Q在约20,000个阶段内学习到一条安全且高奖励的策略,且在训练停止后策略依然有效(Triple-Q-stop),表明其收敛至近似最优的平稳策略。
  • 在连续控制的Dynamic Gym基准测试中,Deep Triple-Q在约45万次训练步骤内实现安全且高奖励的策略,优于WCSAC(后者需450万次步骤)。
  • Triple-Q的计算复杂度与SARSA相当,使其在实际部署中具有可行性。
  • 通过为每个约束维护独立的虚拟队列和效用Q函数,该算法可推广至多约束场景,动作选择通过所有约束Q值的加权和实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。