[论文解读] Mean field for Markov Decision Processes: from Discrete to Continuous Optimization
本文通过平均场近似,建立了具有 N 个相互作用对象的大规模马尔可夫决策过程(MDPs)向由哈密顿-雅可比-贝尔曼(HJB)方程控制的连续时间最优控制问题的收敛性。证明了离散 MDP 的最优奖励几乎必然收敛到连续 HJB 方程的解,从而可通过连续优化实现渐近最优策略设计,并提供了显式的误差界和算法构造。
We study the convergence of Markov Decision Processes made of a large number of objects to optimization problems on ordinary differential equations (ODE). We show that the optimal reward of such a Markov Decision Process, satisfying a Bellman equation, converges to the solution of a continuous Hamilton-Jacobi-Bellman (HJB) equation based on the mean field approximation of the Markov Decision Process. We give bounds on the difference of the rewards, and a constructive algorithm for deriving an approximating solution to the Markov Decision Process from a solution of the HJB equations. We illustrate the method on three examples pertaining respectively to investment strategies, population dynamics control and scheduling in queues are developed. They are used to illustrate and justify the construction of the controlled ODE and to show the gain obtained by solving a continuous HJB equation rather than a large discrete Bellman equation.
研究动机与目标
- 建立大规模马尔可夫决策过程(MDPs)中具有 N 个相互作用对象的最优奖励向连续时间最优控制问题的理论收敛性。
- 证明平均场近似(特别是受控常微分方程)作为大规模离散 MDP 的严格近似是合理的。
- 通过求解连续 HJB 方程而非难以处理的离散贝尔曼方程,为高维 MDP 提供一种计算上可行的动态规划替代方法。
- 推导有限 MDP 的最优奖励与平均场 HJB 方程解之间差异的显式界。
- 开发一种算法框架,从连续 HJB 方程的解中构造出针对有限 N 的渐近最优策略。
提出的方法
- 作者使用一种新颖的耦合技术,将离散 MDP 的每条样本路径与在受控动作下求解的平均场 ODE 的随机轨迹相关联。
- 应用随机逼近和学习理论中的界控技术,以控制离散系统与连续系统之间的差异。
- 通过分析系统的经验驻留测度推导平均场极限,假设在对称、与状态相关的动力学下系统形成一个马尔可夫过程。
- 通过求解连续哈密顿-雅可比-贝尔曼(HJB)方程,推导平均场 ODE 的最优控制策略。
- 提出一种显式算法:数值求解 HJB 方程,然后利用其解构造原始有限 N MDP 的策略。
- 使用几乎必然收敛和依概率收敛的理论证明收敛性,误差界取决于初始条件偏差和系统强度。
实验结果
研究问题
- RQ1在平均场近似下,大规模离散 MDP 的最优奖励是否收敛到连续 HJB 方程的解?
- RQ2连续 HJB 方程的解能否用于构造一个对原始有限 N MDP 渐近最优的策略?
- RQ3有限 MDP 的最优奖励与平均场 HJB 解之间的差异可导出何种显式界?
- RQ4收敛行为如何依赖于系统强度 I(N) 和初始状态分布?
- RQ5在何种条件下,平均场极限的最优策略对有限系统仍保持渐近最优?
主要发现
- 当 N → ∞ 时,有限 N MDP 的最优奖励几乎必然收敛到平均场 HJB 方程的最优值。
- 有限系统最优奖励与平均场解之间的差异由 B(N, δ^N) 有界,其中 δ^N = ||M^N(0) - m_0||,且当 N 增大且初始状态收敛到平均场初始条件时,该界趋于零。
- 在平均场 HJB 框架中,ε-最优策略可导出一个对有限系统的奖励在最优有限奖励的 ε + B(N, δ^N) 以内的策略。
- 该方法在三个示例中得到验证:投资策略、种群动力学控制和排队调度,其中求解连续 HJB 方程可获得接近最优的结果,且计算成本显著降低。
- 该方法对无限时域折扣 MDP 依然有效,因为可通过有界误差的时间截断论证将有限时域结果扩展至无限时域。
- 由于可能存在不连续性和非唯一性,最优策略本身的收敛性在一般情况下无法保证,但最优值的收敛性已得到证明。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。