[论文解读] Unified Reinforcement Q-Learning for Mean Field Game and Control Problems
本文提出了一种统一的双时标强化学习算法 U2-MF-QL,该算法在离散时间与空间下同时学习均场博弈(Mean Field Game, MFG)和均场控制(Mean Field Control, MFC)问题的解。通过调节两个学习率的比率,同一算法可自适应地学习非合作型 MFG 均衡或合作型 MFC 最优解,在线性二次模型中实现对理论基准的收敛,且无需模型信息即可估计群体分布。
We present a Reinforcement Learning (RL) algorithm to solve infinite horizon asymptotic Mean Field Game (MFG) and Mean Field Control (MFC) problems. Our approach can be described as a unified two-timescale Mean Field Q-learning: The \emph{same} algorithm can learn either the MFG or the MFC solution by simply tuning the ratio of two learning parameters. The algorithm is in discrete time and space where the agent not only provides an action to the environment but also a distribution of the state in order to take into account the mean field feature of the problem. Importantly, we assume that the agent can not observe the population's distribution and needs to estimate it in a model-free manner. The asymptotic MFG and MFC problems are also presented in continuous time and space, and compared with classical (non-asymptotic or stationary) MFG and MFC problems. They lead to explicit solutions in the linear-quadratic (LQ) case that are used as benchmarks for the results of our algorithm.
研究动机与目标
- 开发一种单一的强化学习算法,无需架构更改即可求解均场博弈(MFG)和均场控制(MFC)问题。
- 在代理无法直接观测均场的情况下,实现 MFG/MFC 设置中群体分布的无模型学习。
- 通过双时标随机逼近方法,将 MFG 与 MFC 学习统一于同一框架下。
- 通过在基准线性二次问题上的数值实验,验证算法的收敛性与准确性。
- 基于 Q 值的增量变化与经验分布,提供一种实用的停止准则。
提出的方法
- 该算法采用双时标随机逼近框架,分别使用不同的学习率更新 Q 函数(快速时标)与经验分布(慢速时标)。
- 通过引入分布性动作输入,将经典 Q-learning 扩展为反映均场交互的机制,其中代理同时选择动作与状态分布。
- 重新定义动作价值函数以嵌入均场效应,使 Q 函数表示在联合状态-动作分布下的期望折扣奖励。
- 训练过程中采用 $ε$-greedy 策略,当 $ε \to 0$ 时,确定性控制策略逐渐显现。
- 通过在线更新估计状态的遍历分布,利用慢速时标追踪长期经验分布。
- 基于分布的总变差与 Q 值变化的 $L^{1,1}$-范数,实现一种停止准则。
实验结果
研究问题
- RQ1仅通过调节两个学习率的比率,单一强化学习算法是否能够学习到均场博弈与均场控制的解?
- RQ2当群体分布不可观测且必须在线估计时,该算法在学习最优控制与遍历分布方面表现如何?
- RQ3在线性二次基准情形下,该算法的收敛行为如何?与理论解相比表现如何?
- RQ4不同学习率比率对 MFG 与 MFC 设置下算法的稳定性与收敛速度有何影响?
- RQ5能否基于 Q 值的增量变化与分布估计,有效校准该算法的停止准则?
主要发现
- U2-MF-QL 算法通过相同架构仅调节两个学习率的比率,成功学习到 MFG 与 MFC 问题的最优控制与遍历分布。
- 在线性二次基准问题中,该算法在 MFG 与 MFC 情况下均于 100,000 个回合后收敛至理论解,控制误差的均方误差(MSE)低于 0.01。
- 在 MFG 设置中,对遍历均值的估计误差随回合数增加而稳定下降;而在 MFC 设置中,由于分布更新较慢,观察到更快但带有振荡的收敛行为。
- 基于分布总变差与 Q 值变化 $L^{1,1}$-范数的停止准则能有效检测收敛,两项指标均随时间单调递减。
- 当 $(\omega^{Q}, \omega^{\mu}) = (0.55, 0.85)$ 时,算法学习到 MFG 解;当 $(0.65, 0.15)$ 时,学习到 MFC 解,证实了通过学习率调节实现统一。
- 实验结果表明,学习得到的 Q 值与控制策略与理论解高度吻合,价值函数近似误差在所测试状态范围内始终低于 0.02。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。