[论文解读] Efficient Reinforcement Learning in Factored MDPs with Application to Constrained RL
本文提出 FMDP-BF,一种针对因子化马尔可夫决策过程(FMDPs)的高效强化学习算法,其遗憾规模相比非因子化 MDP 算法呈指数级改善。通过利用因子化状态与动作的结构,FMDP-BF 相较于先前工作将遗憾降低了 $\sqrt{nH|\mathcal{S}_i|}$ 倍,并将该框架扩展至一种新型约束强化学习设置——背包约束强化学习(knapsack constraints),实现了近似最优的遗憾边界。
Reinforcement learning (RL) in episodic, factored Markov decision processes (FMDPs) is studied. We propose an algorithm called FMDP-BF, which leverages the factorization structure of FMDP. The regret of FMDP-BF is shown to be exponentially smaller than that of optimal algorithms designed for non-factored MDPs, and improves on the best previous result for FMDPs~\\citep{osband2014near} by a factored of $\\sqrt{H|\\mathcal{S}_i|}$, where $|\\mathcal{S}_i|$ is the cardinality of the factored state subspace and $H$ is the planning horizon. To show the optimality of our bounds, we also provide a lower bound for FMDP, which indicates that our algorithm is near-optimal w.r.t. timestep $T$, horizon $H$ and factored state-action subspace cardinality. Finally, as an application, we study a new formulation of constrained RL, known as RL with knapsack constraints (RLwK), and provides the first sample-efficient algorithm based on FMDP-BF.
研究动机与目标
- 为具有可证明改进遗憾边界的 episodic 因子化 MDP(FMDPs)开发一种样本效率和计算效率更高的强化学习算法。
- 建立 FMDPs 中遗憾的理论下界,以证明所提算法的近似最优性。
- 将 FMDP-BF 框架扩展至一种新的约束强化学习形式——具有背包约束的强化学习(RLwK),以支持现实世界应用。
- 证明 FMDP-BF 的遗憾在时间跨度 $H$、因子化状态-动作子空间大小 $|\mathcal{S}_i|$ 和转移次数 $n$ 上具有有利的缩放特性。
- 解决连续成本分布下价值函数非光滑性的问题,并通过松弛约束或软惩罚提出可行的扩展方案。
提出的方法
- FMDP-BF 将‘面对不确定性时的乐观’(OFU)原则应用于因子化状态-动作子空间,对价值函数维持上界与下界置信区间。
- 该算法在因子化状态-动作子空间上执行嵌套贝尔曼备份,置信区间按 $\sqrt{\log(T)/N(s,a)}$ 缩放,以平衡探索与利用。
- 对每个状态和预算 $\bm{b}$,分别维护上界 $\overline{V}_{k,h}(s,\bm{b})$ 与下界 $\underline{V}_{k,h}(s,\bm{b})$,从而在不确定性下实现稳健策略选择。
- 在背包约束强化学习设置中,算法将预算约束 $\bm{b}$ 纳入价值函数与策略中,基于估计的成本分布与置信区间进行更新。
- 采用对所有可能预算 $\bm{b}$ 与状态-动作对的联合界(union bound),通过 $\log(Bm)$ 的对数惩罚项控制过度估计风险。
- 通过引入松弛的 $\epsilon$-网方法或带有线性惩罚的软约束,处理连续成本分布,确保平滑性与可计算性。
实验结果
研究问题
- RQ1我们能否设计一种针对因子化 MDP 的强化学习算法,使其遗憾显著优于现有非因子化 MDP 算法?
- RQ2相较于 Osband & Van Roy (2014b),$\sqrt{nH|\mathcal{S}_i|}$ 的遗憾改进是否为紧致边界?能否通过下界确认其近似最优性?
- RQ3FMDP-BF 框架能否扩展至具有背包式资源限制的约束强化学习问题?
- RQ4连续成本分布如何影响约束因子化 MDP 中的遗憾与策略平滑性?能否实现高效处理?
- RQ5为保持连续预算空间中遗憾效率,对 MDP 建模需进行哪些修改(如软约束)?
主要发现
- FMDP-BF 实现的遗憾边界相比最优非因子化 MDP 算法呈指数级减小,相较于 Osband & Van Roy (2014b) 提高了 $\sqrt{nH|\mathcal{S}_i|}$ 倍。
- 本文建立了 FMDPs 的遗憾下界,表明所提算法的遗憾在 $T$、$H$ 与 $|\mathcal{S}_i|$ 上为近似最优。
- 对于新颖的 RLwK 建模,FMDP-BF 提供了首个样本高效的算法,其遗憾在 $T$、$S$、$A$ 与 $H$ 上均接近最优。
- 该算法对所有可能的预算状态 $\bm{b}$ 维持置信区间,由于对预算配置的联合界,遗憾边界中包含 $\log(Bm)$ 项。
- 在连续成本设置中,价值函数对剩余预算的非光滑性使得直接估计不可行;本文提出松弛的 $\epsilon$-网或软约束作为可行替代方案。
- 理论分析证实,当将 OFU 原则应用于因子化结构时,可在不牺牲计算效率的前提下实现显著的遗憾降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。