Skip to main content
QUICK REVIEW

[论文解读] Efficient Reinforcement Learning in Factored MDPs with Application to Constrained RL

Xiaoyu Chen, Jiachen Hu|arXiv (Cornell University)|Aug 30, 2020
Reinforcement Learning in Robotics参考文献 27被引用 6
一句话总结

本文提出 FMDP-BF,一种针对因子化马尔可夫决策过程(FMDPs)的高效强化学习算法,其遗憾规模相比非因子化 MDP 算法呈指数级改善。通过利用因子化状态与动作的结构,FMDP-BF 相较于先前工作将遗憾降低了 $\sqrt{nH|\mathcal{S}_i|}$ 倍,并将该框架扩展至一种新型约束强化学习设置——背包约束强化学习(knapsack constraints),实现了近似最优的遗憾边界。

ABSTRACT

Reinforcement learning (RL) in episodic, factored Markov decision processes (FMDPs) is studied. We propose an algorithm called FMDP-BF, which leverages the factorization structure of FMDP. The regret of FMDP-BF is shown to be exponentially smaller than that of optimal algorithms designed for non-factored MDPs, and improves on the best previous result for FMDPs~\\citep{osband2014near} by a factored of $\\sqrt{H|\\mathcal{S}_i|}$, where $|\\mathcal{S}_i|$ is the cardinality of the factored state subspace and $H$ is the planning horizon. To show the optimality of our bounds, we also provide a lower bound for FMDP, which indicates that our algorithm is near-optimal w.r.t. timestep $T$, horizon $H$ and factored state-action subspace cardinality. Finally, as an application, we study a new formulation of constrained RL, known as RL with knapsack constraints (RLwK), and provides the first sample-efficient algorithm based on FMDP-BF.

研究动机与目标

  • 为具有可证明改进遗憾边界的 episodic 因子化 MDP(FMDPs)开发一种样本效率和计算效率更高的强化学习算法。
  • 建立 FMDPs 中遗憾的理论下界,以证明所提算法的近似最优性。
  • 将 FMDP-BF 框架扩展至一种新的约束强化学习形式——具有背包约束的强化学习(RLwK),以支持现实世界应用。
  • 证明 FMDP-BF 的遗憾在时间跨度 $H$、因子化状态-动作子空间大小 $|\mathcal{S}_i|$ 和转移次数 $n$ 上具有有利的缩放特性。
  • 解决连续成本分布下价值函数非光滑性的问题,并通过松弛约束或软惩罚提出可行的扩展方案。

提出的方法

  • FMDP-BF 将‘面对不确定性时的乐观’(OFU)原则应用于因子化状态-动作子空间,对价值函数维持上界与下界置信区间。
  • 该算法在因子化状态-动作子空间上执行嵌套贝尔曼备份,置信区间按 $\sqrt{\log(T)/N(s,a)}$ 缩放,以平衡探索与利用。
  • 对每个状态和预算 $\bm{b}$,分别维护上界 $\overline{V}_{k,h}(s,\bm{b})$ 与下界 $\underline{V}_{k,h}(s,\bm{b})$,从而在不确定性下实现稳健策略选择。
  • 在背包约束强化学习设置中,算法将预算约束 $\bm{b}$ 纳入价值函数与策略中,基于估计的成本分布与置信区间进行更新。
  • 采用对所有可能预算 $\bm{b}$ 与状态-动作对的联合界(union bound),通过 $\log(Bm)$ 的对数惩罚项控制过度估计风险。
  • 通过引入松弛的 $\epsilon$-网方法或带有线性惩罚的软约束,处理连续成本分布,确保平滑性与可计算性。

实验结果

研究问题

  • RQ1我们能否设计一种针对因子化 MDP 的强化学习算法,使其遗憾显著优于现有非因子化 MDP 算法?
  • RQ2相较于 Osband & Van Roy (2014b),$\sqrt{nH|\mathcal{S}_i|}$ 的遗憾改进是否为紧致边界?能否通过下界确认其近似最优性?
  • RQ3FMDP-BF 框架能否扩展至具有背包式资源限制的约束强化学习问题?
  • RQ4连续成本分布如何影响约束因子化 MDP 中的遗憾与策略平滑性?能否实现高效处理?
  • RQ5为保持连续预算空间中遗憾效率,对 MDP 建模需进行哪些修改(如软约束)?

主要发现

  • FMDP-BF 实现的遗憾边界相比最优非因子化 MDP 算法呈指数级减小,相较于 Osband & Van Roy (2014b) 提高了 $\sqrt{nH|\mathcal{S}_i|}$ 倍。
  • 本文建立了 FMDPs 的遗憾下界,表明所提算法的遗憾在 $T$、$H$ 与 $|\mathcal{S}_i|$ 上为近似最优。
  • 对于新颖的 RLwK 建模,FMDP-BF 提供了首个样本高效的算法,其遗憾在 $T$、$S$、$A$ 与 $H$ 上均接近最优。
  • 该算法对所有可能的预算状态 $\bm{b}$ 维持置信区间,由于对预算配置的联合界,遗憾边界中包含 $\log(Bm)$ 项。
  • 在连续成本设置中,价值函数对剩余预算的非光滑性使得直接估计不可行;本文提出松弛的 $\epsilon$-网或软约束作为可行替代方案。
  • 理论分析证实,当将 OFU 原则应用于因子化结构时,可在不牺牲计算效率的前提下实现显著的遗憾降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。