[论文解读] Reinforcement Learning for Multi-Objective and Constrained Markov Decision Processes
本文通过将约束性与多目标马尔可夫决策过程(MDPs)建模为零和马尔可夫-老虎机博弈,提出了一种新颖的Q-learning算法,其中智能体在优化奖励的同时,由对手强制执行约束。该方法在折扣奖励与平均奖励设置下均保证收敛至最优平稳策略,仿真结果验证了其收敛至近似最优解的能力。
In this paper, we consider the problem of optimization and learning for constrained and multi-objective Markov decision processes, for both discounted rewards and expected average rewards. We formulate the problems as zero-sum games where one player (the agent) solves a Markov decision problem and its opponent solves a bandit optimization problem, which we here call Markov-Bandit games. We extend Q-learning to solve Markov-Bandit games and show that our new Q-learning algorithms converge to the optimal solutions of the zero-sum Markov-Bandit games, and hence converge to the optimal solutions of the constrained and multi-objective Markov decision problems. We provide a numerical example where we calculate the optimal policies and show by simulations that the algorithm converges to the calculated optimal policies. To the best of our knowledge, this is the first time learning algorithms guarantee convergence to optimal stationary policies for the constrained MDP problem with discounted and expected average rewards, respectively.
研究动机与目标
- 解决现有通用强化学习算法在系统动力学与约束函数未知的约束性与多目标MDP中缺乏收敛至最优策略保证的问题。
- 将Q-learning扩展至处理在多重约束下具有折扣奖励与期望平均奖励形式的问题。
- 开发一种学习框架,可在未知系统动力学与约束函数的前提下,同时优化智能体奖励并满足约束要求。
- 通过数值仿真与线性规划基准对比,展示所提算法收敛至最优策略的能力。
提出的方法
- 将约束性与多目标MDP建模为零和马尔可夫-老虎机博弈,其中智能体求解马尔可夫决策问题,而对手通过类似老虎机的优化方式强制执行约束。
- 提出一种扩展的Q-learning算法,联合学习状态、动作与约束参数o的值函数Q(s, a, o),以支持极小化-极大化优化。
- 采用对偶优化方法,使智能体在最大化自身奖励的同时最小化最坏情况下的约束违反,将其建模为对约束参数的极小化-极大化问题。
- 通过采样轨迹迭代更新Q表,利用10,000条轨迹估计约束值,以确保统计置信度。
- 在目标值δ上采用类似二分查找的搜索方法,以识别最优可行奖励水平,以约束函数的收敛性作为可行性指标。
- 理论上证明了该算法可收敛至零和马尔可夫-老虎机博弈的最优解,该解对应于原始约束性MDP的最优策略。
实验结果
研究问题
- RQ1当系统动力学与约束函数未知时,强化学习算法是否能在约束性MDP中收敛至最优平稳策略?
- RQ2如何对具有多个奖励与约束目标的多目标MDP进行重构,以支持基于学习的优化?
- RQ3是否能够将Q-learning扩展至在多重约束下处理折扣奖励与平均奖励形式,并保证理论收敛性?
- RQ4与通过线性规划获得的已知最优解相比,所提算法在实际中的表现如何?
主要发现
- 所提Q-learning算法在理论上证明可收敛至具有折扣奖励与期望平均奖励的约束性MDP问题的最优策略。
- 在单服务器队列模型上的仿真表明,该算法能成功识别可行策略:当δ = 9.5时,所有约束值保持非负,表明可行性;而当δ = 9.7时,所有约束值为负,表明不可行。
- 最优目标值位于δ = 9.55至δ = 9.625之间,算法在105次迭代后最佳估计值达到9.55,接近线性规划基准值9.62。
- 在δ = 9.5时,所有三个约束的值收敛至相近水平,表明该算法能有效平衡多重约束。
- 该算法性能对迭代次数与采样规模敏感,更多迭代与采样可提升收敛精度至最优值。
- 尽管迭代次数(105次)与采样量(10,000条轨迹)有限,该方法仍实现近似最优性能,表明其在实际计算约束下具备鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。