[论文解读] A Simple Reward-free Approach to Constrained Reinforcement Learning
本文提出了一种元算法,利用无奖励强化学习(RL)预言机来解决约束型RL问题,且额外样本复杂度极低。通过将动态学习与约束处理解耦,该方法在表格型MDP和线性MDP中实现了最先进(SOTA)的样本复杂度,其结果与先前最佳成果相比,仅在与时域相关的因子上存在差异,并首次在具有通用凸约束的线性MDP设置中提供了样本高效的解决方案。
In constrained reinforcement learning (RL), a learning agent seeks to not only optimize the overall reward but also satisfy the additional safety, diversity, or budget constraints. Consequently, existing constrained RL solutions require several new algorithmic ingredients that are notably different from standard RL. On the other hand, reward-free RL is independently developed in the unconstrained literature, which learns the transition dynamics without using the reward information, and thus naturally capable of addressing RL with multiple objectives under the common dynamics. This paper bridges reward-free RL and constrained RL. Particularly, we propose a simple meta-algorithm such that given any reward-free RL oracle, the approachability and constrained RL problems can be directly solved with negligible overheads in sample complexity. Utilizing the existing reward-free RL solvers, our framework provides sharp sample complexity results for constrained RL in the tabular MDP setting, matching the best existing results up to a factor of horizon dependence; our framework directly extends to a setting of tabular two-player Markov games, and gives a new result for constrained RL with linear function approximation.
研究动机与目标
- 通过将约束满足与动态学习分离,弥合无奖励RL与约束型RL之间的鸿沟。
- 开发一种元算法,利用任意无奖励RL预言机求解可逼近性和约束型MDP问题,且样本开销可忽略不计。
- 为表格型和线性MDP中的约束型RL实现紧致的样本复杂度界,其结果与或优于现有成果。
- 将该框架扩展至具有向量值约束的双人马尔可夫博弈,并提供低遗憾保证。
提出的方法
- 该元算法使用无奖励RL预言机预先收集轨迹,并在无奖励监督的情况下学习MDP动态。
- 随后将约束满足形式化为一个独立的优化问题,从而将其与值函数学习解耦。
- 该方法采用对偶优化框架,通过在经验模型下对参数化策略进行优化来强制执行约束。
- 通过在Q值和V值函数上的置信区间引入不确定性界,并利用递归不确定性传播机制进行控制。
- 该算法在策略参数上采用极小化-极大化策略,以确保对经验模型中估计误差的鲁棒性。
- 该方法应用霍夫丁型大偏差不等式,以在高概率事件中界定估计误差,从而保证泛化能力。
实验结果
研究问题
- RQ1无奖励RL能否作为基础组件,以极低的额外样本成本解决约束型RL问题?
- RQ2在约束型MDP中,如何将约束满足与动态学习及值函数优化解耦?
- RQ3使用该元算法,可在表格型和线性MDP中实现何种样本复杂度界?
- RQ4该框架能否扩展至具有向量值约束的双人马尔可夫博弈,并仍能实现低遗憾?
- RQ5时域依赖性对所提方法最终样本复杂度的影响是什么?
主要发现
- 该方法在所有三项任务中(向量值MDP的无奖励RL、可逼近性、约束型MDP)均实现了 $\tilde{\mathcal{O}}(\min\{d,S\}H^{4}SA/\epsilon^{2})$ 的样本复杂度,适用于表格型MDP。
- 对于线性MDP,该框架首次实现了样本高效的解法,三项任务的样本复杂度均为 $\tilde{\mathcal{O}}(d_{\text{lin}}^{3}H^{6}/\epsilon^{2})$。
- 在表格型MDP中,该方法的性能与现有最佳成果相比,仅在时域依赖性上相差一个 $H$ 因子。
- 在双人马尔可夫博弈设置中,该框架实现了 $\alpha(T) = \mathcal{O}(\epsilon/2 + \sqrt{H^{2}\iota/T})$ 的遗憾界,其中存在 $\mathcal{O}(\epsilon)$ 的偏差。
- 该框架实现了无奖励RL领域进展向约束型RL的直接迁移,显著减少了算法重新设计的需求。
- 通过大偏差不等式和递归不确定性界,建立了高概率下的理论保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。