Skip to main content
QUICK REVIEW

[论文解读] Learning with Safety Constraints: Sample Complexity of Reinforcement Learning for Constrained MDPs

Aria HasanzadeZonuzy, Archana Bura|arXiv (Cornell University)|Aug 1, 2020
Reinforcement Learning in Robotics被引用 11
一句话总结

本文提出了一种基于模型的强化学习算法,用于处理具有未知动态特性的约束马尔可夫决策过程(CMDPs),采用生成式学习和在线学习方法,以确保安全性和最优性。研究结果表明,样本复杂度仅随约束数量的对数增长,使得约束强化学习在具有大量安全约束的实际网络物理系统中具备可行性。

ABSTRACT

Many physical systems have underlying safety considerations that require that the policy employed ensures the satisfaction of a set of constraints. The analytical formulation usually takes the form of a Constrained Markov Decision Process (CMDP). We focus on the case where the CMDP is unknown, and RL algorithms obtain samples to discover the model and compute an optimal constrained policy. Our goal is to characterize the relationship between safety constraints and the number of samples needed to ensure a desired level of accuracy -- both objective maximization and constraint satisfaction -- in a PAC sense. We explore two classes of RL algorithms, namely, (i) a generative model based approach, wherein samples are taken initially to estimate a model, and (ii) an online approach, wherein the model is updated as samples are obtained. Our main finding is that compared to the best known bounds of the unconstrained regime, the sample complexity of constrained RL algorithms are increased by a factor that is logarithmic in the number of constraints, which suggests that the approach may be easily utilized in real systems.

研究动机与目标

  • 开发在模型不确定条件下针对CMDPs的样本高效强化学习算法,确保目标最大化和约束满足。
  • 在可能近似正确(PAC)学习框架下,量化安全约束与样本复杂度之间的权衡。
  • 设计在有限交互中学习准确模型的同时,保持可行性与乐观性的算法。
  • 提供实现性能和约束合规性所需精度水平的样本数量的理论边界。
  • 评估约束数量是否显著增加学习难度,尤其是在大规模网络物理系统中。

提出的方法

  • 提出一种基于生成模型的方法,在通过线性规划(LP)求解CMDP之前,利用初始样本估计MDP模型。
  • 引入一种在线学习变体,随着新数据的到来逐步更新模型和策略,通过在估计值周围使用置信球来维持可行性。
  • 利用模型估计值周围的置信球,确保即使估计模型不准确,仍存在可行解。
  • 将标准LP公式扩展至在整个模型置信球范围内搜索,确保策略选择过程中的乐观性与可行性。
  • 采用PAC风格分析,界定为实现价值和约束满足的期望精度所需样本数量。
  • 通过结合浓度不等式和状态-动作对及约束上的误差传播分析,推导出样本复杂度边界。

实验结果

研究问题

  • RQ1与无约束MDP相比,多个安全约束的存在如何影响CMDPs中学习的样本复杂度?
  • RQ2针对CMDPs的基于模型的强化学习算法是否能在最小化约束违反的前提下,同时保持可行性和乐观性?
  • RQ3在PAC学习框架下,样本复杂度相对于约束数量和状态空间大小的缩放关系如何?
  • RQ4在样本效率和约束满足保证方面,生成式学习与在线学习方法有何比较优势?
  • RQ5由于约束导致的样本复杂度增加是否具有灾难性影响,还是其缩放关系有利(例如,对数关系)?

主要发现

  • 与无约束强化学习相比,约束强化学习的样本复杂度仅随约束数量的对数因子增长,表明开销可控。
  • 所提算法保证所学策略在高概率下实现接近最优的目标值,并满足所有约束。
  • 生成式与在线方法均实现了PAC边界,样本复杂度呈 O(|S|H²/ε²) 的形式,且包含约束数量和状态空间的对数项。
  • 次优轨迹数量被限制在 O(|S|²|A|H²/ε²) 的对数项内,确保在有限次轨迹内收敛。
  • 对约束数量的对数依赖关系表明,即使存在大量安全约束,该方法仍具备实用性。
  • 通过在状态-动作对和约束索引上应用浓度不等式与联合界,验证了理论边界的鲁棒性,确保在不确定性下的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。