[论文解读] Mutation-Driven Follow the Regularized Leader for Last-Iterate Convergence in Zero-Sum Games
本文提出了一种新型的 FTRL 变体——突变 FTRL(M-FTRL),该方法在两人零和博弈中引入了基于突变的扰动,以调整动作概率。通过将连续时间动态建模为复制者-突变动态(RMD),M-FTRL 实现了对近似纳什均衡的末次迭代收敛,且收敛速率呈指数级,优于标准 FTRL 和乐观 FTRL,在完整信息与部分信息(bandit)反馈设置下均表现更优。
In this study, we consider a variant of the Follow the Regularized Leader (FTRL) dynamics in two-player zero-sum games. FTRL is guaranteed to converge to a Nash equilibrium when time-averaging the strategies, while a lot of variants suffer from the issue of limit cycling behavior, i.e., lack the last-iterate convergence guarantee. To this end, we propose mutant FTRL (M-FTRL), an algorithm that introduces mutation for the perturbation of action probabilities. We then investigate the continuous-time dynamics of M-FTRL and provide the strong convergence guarantees toward stationary points that approximate Nash equilibria under full-information feedback. Furthermore, our simulation demonstrates that M-FTRL can enjoy faster convergence rates than FTRL and optimistic FTRL under full-information feedback and surprisingly exhibits clear convergence under bandit feedback.
研究动机与目标
- 为解决标准 FTRL 及其变体在缺乏时间平均时往往陷入循环而无法实现末次迭代收敛的问题。
- 开发一种无遗憾学习算法,可直接收敛至近似纳什均衡的驻定点。
- 探究基于突变的扰动是否能够稳定学习动态,并在部分信息反馈下实现收敛。
- 在一般正则化函数和连续时间动态下,建立 M-FTRL 的理论收敛保证。
- 通过实验验证 M-FTRL 在多种博弈设置下相较于 FTRL 和乐观 FTRL 具有更快的收敛速度和更强的鲁棒性。
提出的方法
- M-FTRL 引入一个突变参数 μ,用于对动作概率施加扰动,通过加入随机扰动项来修改标准 FTRL 的更新规则。
- 分析了 M-FTRL 的连续时间动态,发现在使用熵正则化时,其动态等价于复制者-突变动态(RMD)。
- 该方法采用基于参考策略 ci 的时间平均策略更新,并使用自适应参考策略以加速收敛。
- 在 bandit 反馈场景下,M-FTRL 使用重要性加权估计器,无需依赖无偏收益估计器,这与 FTRL 和 O-FTRL 不同。
- 理论分析证明,M-FTRL 的轨迹会收敛至 RMD 的驻定点,在熵正则化下实现指数收敛。
- 该算法可采用固定或自适应参考策略,且突变参数 μ 经调优以平衡探索与收敛速度。
实验结果
研究问题
- RQ1在两人零和博弈中,FTRL 动态中的突变驱动扰动是否能确保末次迭代收敛?
- RQ2在完整信息反馈下,M-FTRL 的收敛速率是否快于 FTRL 和乐观 FTRL?
- RQ3在 bandit 反馈下(仅能获得部分收益信息),M-FTRL 是否仍能保持末次迭代收敛?
- RQ4M-FTRL 动态的驻定点是否唯一,且对初始策略选择具有鲁棒性?
- RQ5M-FTRL 与复制者-突变动态(RMD)之间存在何种理论关系?
主要发现
- 当使用熵正则化时,M-FTRL 以指数收敛速率收敛至 RMD 的驻定点,建立了全新的理论保证。
- 在完整信息反馈下,M-FTRL 的可被利用性衰减速度快于 FTRL 和乐观 FTRL,且自适应参考策略可使可被利用性趋近于零。
- 在 bandit 反馈设置中,M-FTRL 展现出明确的末次迭代收敛特性,而 O-FTRL 无法收敛,表明其对部分信息具有强鲁棒性。
- 在熵正则化下,M-FTRL 的动态在数学上等价于 RMD,为学习算法与演化博弈动态之间建立了新联系。
- 对于 10×10 和 50×50 的随机效用博弈,M-FTRL 搭配自适应参考策略在 100 个实例中平均实现近乎零的可被利用性。
- M-FTRL 的驻定点唯一且与初始策略无关,该结论在 M-Eq 和 RBPS 博弈中得到验证,支持了理论上的唯一性结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。