[论文解读] Q-Learning in Regularized Mean-field Games
本文提出了一种正则化平均场博弈框架,增强了强化学习中的鲁棒性,并在无需强凸性假设的条件下实现了误差分析。通过在单阶段奖励中引入强凹正则化项,作者开发了一种拟合Q-learning算法,确保最优策略的Lipschitz连续性,从而在比以往工作更宽松的条件下提供了收敛性保证。
In this paper, we introduce a regularized mean-field game and study learning of this game under an infinite-horizon discounted reward function. Regularization is introduced by adding a strongly concave regularization function to the one-stage reward function in the classical mean-field game model. We establish a value iteration based learning algorithm to this regularized mean-field game using fitted Q-learning. The regularization term in general makes reinforcement learning algorithm more robust to the system components. Moreover, it enables us to establish error analysis of the learning algorithm without imposing restrictive convexity assumptions on the system components, which are needed in the absence of a regularization term.
研究动机与目标
- 为在最小假设下建立平均场博弈学习中的收敛性和误差界提供解决方案。
- 克服以往工作要求奖励函数具有强凸性和光滑性以保证策略Lipschitz连续性的局限。
- 开发一种基于值迭代的学习算法,确保在正则化设置下收敛至平均场均衡。
- 通过利用正则化稳定策略学习,将无模型Q-learning推广至平均场博弈。
- 在不施加系统组件上严格凸性条件的前提下,为学习算法提供理论误差界。
提出的方法
- 通过在单阶段奖励中添加一个强凹函数,引入正则化平均场博弈,提升稳定性与鲁棒性。
- 提出一种基于拟合Q-learning的值迭代算法,以在无限时域折扣奖励准则下求解正则化平均场博弈。
- 利用强凸性与光滑性之间的对偶关系,建立最优策略关于平均场项的Lipschitz连续性。
- 采用误差分析技术,界定最优策略的正则化值函数与ε-最优策略之间的差异。
- 利用奖励、转移核和值函数的Lipschitz常数,推导出定量误差界,从而获得收敛速率。
- 利用有限群体博弈向平均场极限收敛的性质,表明有限系统中的ε-Nash均衡近似平均场均衡。
实验结果
研究问题
- RQ1在平均场博弈中引入正则化是否能实现Q-learning算法的收敛,而无需假设奖励函数具有强凸性?
- RQ2正则化如何影响最优策略关于平均场分布的Lipschitz连续性?
- RQ3在最小假设下,能否为正则化平均场博弈中的拟合Q-learning算法建立误差界?
- RQ4与无正则化模型相比,正则化平均场博弈框架在学习中的鲁棒性和稳定性改善程度如何?
- RQ5在正则化设置下,有限群体博弈均衡如何收敛至平均场均衡?
主要发现
- 正则化项确保最优策略关于平均场分布具有Lipschitz连续性,从而实现最优算子的压缩性。
- 作者在温和正则性条件下建立了如下误差界:$\|J_{\mu_*}^{\text{reg}}(\pi_*,\cdot) - J_{\mu_*}^{\text{reg}}(\pi_\varepsilon,\cdot)\|_{\infty} \leq \frac{C_3 \varepsilon}{1 - \beta}$,其中$C_3 = L_1 + L_{\text{reg}} + \frac{\beta K_1 K_{\text{Lip}}}{2}$。
- 在正则化框架下,拟合Q-learning算法即使在不假设奖励函数具有强凸性或光滑性时,也能收敛至平均场均衡。
- 最优策略与ε-最优策略之间值函数差异的误差界为$\frac{C_2 \varepsilon}{1 - \beta}$,其中$C_2 = \left(L_1 + \frac{\beta K_1 K_{\text{Lip}}}{2}\right)\frac{K_1}{1 - C_1}$,表明其依赖于策略近似误差。
- 有限群体博弈收敛至平均场均衡,且当$N \to \infty$时,ε-Nash性质渐近成立,即对充分大的$N$,有$J_1^{(N)}(\boldsymbol{\pi}^{(N)}) \geq \sup_{\pi^1} J_1^{(N)}(\boldsymbol{\pi}^{(N)}_{-1}, \pi^1) - \tau\varepsilon - \delta$。
- 该框架消除了以往为证明平均场均衡算子压缩性而必需的强凸性和光滑性假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。