[论文解读] Reinforcement Learning of Markov Decision Processes with Peak Constraints
该论文提出了一种针对具有峰值约束的马尔可夫决策过程的内存高效强化学习算法,通过拉格朗日松弛和裁剪技术将约束问题转化为有界无约束优化问题。该方法无需存储约束函数值即可保证收敛至最优策略,在动态和奖励函数未知的情况下实现可行性与最优性。
In this paper, we consider reinforcement learning of Markov Decision Processes (MDP) with peak constraints, where an agent chooses a policy to optimize an objective and at the same time satisfy additional constraints. The agent has to take actions based on the observed states, reward outputs, and constraint-outputs, without any knowledge about the dynamics, reward functions, and/or the knowledge of the constraint-functions. We introduce a game theoretic approach to construct reinforcement learning algorithms where the agent maximizes an unconstrained objective that depends on the simulated action of the minimizing opponent which acts on a finite set of actions and the output data of the constraint functions (rewards). We show that the policies obtained from maximin Q-learning converge to the optimal policies. To the best of our knowledge, this is the first time learning algorithms guarantee convergence to optimal stationary policies for the MDP problem with peak constraints for both discounted and expected average rewards.
研究动机与目标
- 解决在实时约束下必须满足但约束函数未知的MDP中的强化学习问题。
- 开发一种学习算法,避免存储所有状态-动作对的约束值,将内存成本从O(S×A×J)降低至最小。
- 在折扣奖励和平均奖励标准下,保证收敛至最优且可行的平稳策略。
- 使该方法可实际部署于无线通信和医疗保健等安全关键应用中,其中约束违反是不可接受的。
提出的方法
- 使用拉格朗日松弛和对偶变量,将原始约束MDP转化为等价的无约束问题。
- 定义裁剪奖励函数 R(s,a) = max(−C, minλ≥0 R(s,a,λ)) 以确保有界性,并支持稳定的Q-learning。
- 使用裁剪后的奖励执行Q-learning更新,迭代学习最优Q值函数 Q*(s,a)。
- 基于学习到的Q值,通过 π*(s) = argmaxπ∈Π E[Q*(s,π(s))] 推导最优策略。
- 通过证明裁剪奖励形式保留了原始问题的最优性和可行性,确保收敛。
- 利用理论结果表明,当原始问题可行时,变换后问题的解对应于原始问题的最优策略。
实验结果
研究问题
- RQ1是否可以在约束函数未知的情况下,将强化学习应用于具有未知峰值约束的MDP,并保证收敛至最优且可行的策略?
- RQ2当约束函数无法预先获知时,如何最小化约束强化学习中的内存使用?
- RQ3对目标函数的何种变换可同时保证有界性与与原始约束问题的等价性?
- RQ4所提方法在折扣奖励和平均奖励标准下是否仍能保持最优性和可行性?
- RQ5该算法能否避免存储所有约束函数值 (s,a)↦rj(s,a),同时仍能学习可行性集 A(s)?
主要发现
- 所提算法保证在具有峰值约束的折扣奖励和期望平均奖励MDP中收敛至最优平稳策略。
- 通过消除对所有(s,a)对的约束函数值 rj(s,a) 的存储需求,实现了内存效率。
- 通过裁剪拉格朗日奖励 R(s,a) = max(−C, minλ≥0 R(s,a,λ)) 的变换,确保了有界性,并使标准Q-learning能够收敛。
- 当原始问题可行时,从学习到的Q值推导出的最优策略在理论上被证明对原始约束问题是最优且可行的。
- 理论分析证实,在标准MDP假设下,变换后问题的解等价于原始约束MDP的解。
- 该方法适用于无线功率控制和搜索引擎排名等实际问题,其中安全约束必须严格遵守。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。