Skip to main content
QUICK REVIEW

[论文解读] Independent Natural Policy Gradient Always Converges in Markov Potential Games

Roy Fox, Stephen McAleer|arXiv (Cornell University)|Oct 20, 2021
Reinforcement Learning in Robotics被引用 6
一句话总结

本文证明了在常数学习率下,独立自然策略梯度(INPG)在马尔可夫势博弈(MPGs)中收敛至纳什均衡,即使MPGs不存在唯一最优值。关键洞见在于INPG等价于对势函数进行自然梯度上升,从而确保单调改进并全局收敛至均衡策略。

ABSTRACT

Multi-agent reinforcement learning has been successfully applied to fully-cooperative and fully-competitive environments, but little is currently known about mixed cooperative/competitive environments. In this paper, we focus on a particular class of multi-agent mixed cooperative/competitive stochastic games called Markov Potential Games (MPGs), which include cooperative games as a special case. Recent results have shown that independent policy gradient converges in MPGs but it was not known whether Independent Natural Policy Gradient converges in MPGs as well. We prove that Independent Natural Policy Gradient always converges in the last iterate using constant learning rates. The proof deviates from the existing approaches and the main challenge lies in the fact that Markov Potential Games do not have unique optimal values (as single-agent settings exhibit) so different initializations can lead to different limit point values. We complement our theoretical results with experiments that indicate that Natural Policy Gradient outperforms Policy Gradient in routing games and congestion games.

研究动机与目标

  • 建立独立自然策略梯度(INPG)在马尔可夫势博弈(MPGs)中的收敛性,MPGs是一类广义的合作与竞争设置的多智能体博弈。
  • 解决INPG在单智能体设置中表现优于标准策略梯度,但在MPGs中是否收敛的开放问题。
  • 为INPG的最后迭代收敛提供理论保证,尽管MPGs中不存在唯一最优值。
  • 通过实验补充理论分析,表明INPG在路由和拥塞博弈中相比独立策略梯度收敛更快。

提出的方法

  • 证明INPG等价于在MPG所诱导的势函数Φ上的自然梯度上升。
  • 通过利用由Fisher信息矩阵诱导的马氏距离下Φ梯度的局部Lipschitz连续性,建立Φ在INPG更新下非递减的性质。
  • 利用softmax参数化结构以及与乘法权重更新的联系,证明INPG的极限点为纳什均衡。
  • 利用在MPGs中最大化势函数可得纯纳什均衡的事实,实现向均衡策略的收敛。
  • 采用常数学习率,并证明对任意足够小的学习率步长η,均可实现渐近收敛。
  • 通过在具有不同智能体数量的随机拥塞和路由博弈中进行实验,验证理论结果。

实验结果

研究问题

  • RQ1在使用常数学习率时,独立自然策略梯度(INPG)是否收敛至马尔可夫势博弈(MPGs)中的纳什均衡?
  • RQ2MPGs中缺乏唯一最优值,与单智能体设置相比,如何影响INPG的收敛行为?
  • RQ3在MPGs背景下,INPG与势函数上自然梯度上升的等价性能否被形式化建立?
  • RQ4在多智能体混合合作-竞争环境中,INPG与独立策略梯度(IPG)之间的经验性能差距如何?
  • RQ5当智能体数量增加时,INPG是否仍能保持快速收敛,超越IPG在合理迭代次数内无法收敛的范围?

主要发现

  • 在常数学习率下,INPG在马尔可夫势博弈中渐近收敛至纳什均衡策略,即使不同初始化导致不同的极限值。
  • 收敛性对足够小的学习率得到保证,因为过大的步长可能引发混沌行为,如相关算法(如乘法权重更新)中所见。
  • INPG在收敛速度上优于IPG:在4个智能体的拥塞博弈中,INPG约在50次迭代内收敛,而IPG需约2000次迭代。
  • 在8个智能体的情况下,INPG在100次迭代内收敛,而IPG在3000次迭代内未能收敛,展现出显著的可扩展性优势。
  • 实验结果证实,单智能体强化学习中观察到的PG与NPG之间的性能差距在多智能体环境中依然存在,尤其是在平坦损失区域。
  • 理论框架表明,INPG等价于势函数上的自然梯度上升,这确保了Φ的单调非减性,并支持向均衡策略的收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。