Skip to main content
QUICK REVIEW

[论文解读] Constrained episodic reinforcement learning in concave-convex and knapsack settings

Kianté Brantley, Miroslav Dudı́k|arXiv (Cornell University)|Jun 9, 2020
Reinforcement Learning in Robotics参考文献 40被引用 14
一句话总结

本文提出了一种新型算法,用于约束性 episodic 强化学习,在两个关键设置中实现了强大的理论保证:凹-凸(在凸约束下最大化凹函数奖励)和 knapsack(随时间的硬性资源限制)。该方法采用不确定性下的乐观性策略,通过高估奖励和低估资源使用,实现高效探索,并获得任意时间 regret 边界,优于先前的方法在实验基准中的表现。

ABSTRACT

We propose an algorithm for tabular episodic reinforcement learning with constraints. We provide a modular analysis with strong theoretical guarantees for settings with concave rewards and convex constraints, and for settings with hard constraints (knapsacks). Most of the previous work in constrained reinforcement learning is limited to linear constraints, and the remaining work focuses on either the feasibility question or settings with a single episode. Our experiments demonstrate that the proposed algorithm significantly outperforms these approaches in existing constrained episodic environments.

研究动机与目标

  • 为解决约束性 episodic 强化学习中样本效率探索不足的问题,特别是针对非线性目标函数和硬性约束。
  • 在 episodic 设置下,为凹-凸和 knapsack 约束设置提供理论 regret 保证,这些此前尚未被解决。
  • 确保在学习过程中的任意时刻约束违规均被限制(任意时间保证),这对实际部署至关重要。
  • 将不确定性下的乐观性从 bandits 扩展到具有指数级策略空间的 episodic 强化学习。
  • 通过实验基准,显著展示该方法在样本效率和约束满足方面优于先前的约束性强化学习方法。

提出的方法

  • 通过在价值函数优化中高估奖励和低估资源消耗(即高估约束距离)来使用不确定性下的乐观性。
  • 采用模块化分析框架,首先推导线性奖励和约束设置下的保证,然后扩展到凹-凸和 knapsack 情况。
  • 应用任意时间 Hoeffding 类浓度不等式,以限制估计误差并确保任意时间 regret 保证。
  • 引入一个约束规划器,用于在奖励的乐观估计和约束的保守估计下求解策略。
  • 使用带 bonus 项的经验风险最小化,以平衡探索与约束满足。
  • 采用两阶段优化:第一阶段,使用乐观 bonus 学习价值函数;第二阶段,使用这些估计求解约束规划问题。

实验结果

研究问题

  • RQ1我们能否在具有凸约束的凹奖励函数下,实现 episodic 强化学习中的强 regret 边界?
  • RQ2我们能否为 knapsack 等硬性约束设置提供任意时间 regret 保证,其中若违反约束则代理必须停止?
  • RQ3如何有效将不确定性下的乐观性从多臂赌博机扩展到具有指数级策略空间的 episodic 马尔可夫决策过程?
  • RQ4所提出的方法能否在 episodic 基准中显著优于先前方法,在样本效率和约束满足方面表现更优?
  • RQ5算法设计选择(如 bonus 结构、规划器迭代次数)对实验性能有何影响?

主要发现

  • 该算法首次在凹-凸和 knapsack 设置下实现了约束性 episodic 强化学习的任意时间 regret 边界。
  • 实验结果表明,与先前方法(包括 TFW-UCRL2 和基于 A2C 的基线)相比,性能有显著提升,尤其在探索密集型环境中。
  • 由于其任意时间保证,该算法在学习过程中始终维持有界的约束违规,即使训练被中断亦然。
  • 与具有相似理论框架的先前工作相比,使用更紧致的 bonus 机制带来了更优的实验性能。
  • 超参数调优表明,conplanner 迭代次数和 lambda 学习率显著影响性能,在 Gridworld 和 Box 环境中,10 次迭代和 0.2 学习率达到最优结果。
  • 该方法在奖励最大化和约束满足两方面均优于基线,尤其在需要长时程探索的设置中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。