Skip to main content
QUICK REVIEW

[论文解读] Last-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games

Chen-Yu Wei, Chung‐Wei Lee|arXiv (Cornell University)|Feb 8, 2021
Reinforcement Learning in Robotics参考文献 44被引用 13
一句话总结

本文提出了一种基于乐观梯度下降/上升(OGDA)的去中心化对称算法,结合缓慢更新的评论家(critic),用于无限时域双人零和马尔可夫博弈。该算法在自对弈中实现了有限时间内的最后迭代收敛至纳什均衡,同时具备合理性、无偏性与收敛性,是首个在该设置中同时满足这四个特性的算法。

ABSTRACT

We study infinite-horizon discounted two-player zero-sum Markov games, and develop a decentralized algorithm that provably converges to the set of Nash equilibria under self-play. Our algorithm is based on running an Optimistic Gradient Descent Ascent algorithm on each state to learn the policies, with a critic that slowly learns the value of each state. To the best of our knowledge, this is the first algorithm in this setting that is simultaneously rational (converging to the opponent's best response when it uses a stationary policy), convergent (converging to the set of Nash equilibria under self-play), agnostic (no need to know the actions played by the opponent), symmetric (players taking symmetric roles in the algorithm), and enjoying a finite-time last-iterate convergence guarantee, all of which are desirable properties of decentralized algorithms.

研究动机与目标

  • 开发一种用于双人零和马尔可夫博弈的去中心化算法,使其在自对弈中收敛至纳什均衡。
  • 确保该算法具备合理性,即对任何平稳对手策略均能最优响应。
  • 实现在无需全局知识或协调的情况下,有限时间内的最后迭代收敛。
  • 在去中心化环境中保持对称性、无偏性与收敛性保证。
  • 将OGDA——此前仅用于矩阵博弈——扩展至更复杂的无限时域马尔可夫博弈非凸设置。

提出的方法

  • 该算法在每个状态上使用乐观梯度下降/上升(OGDA)更新策略,采用延迟更新规则以稳定学习过程。
  • 通过递归更新:$V_t^s = (1 - \alpha_t)V_{t-1}^s + \alpha_t \rho_t^s$,使评论家缓慢学习价值函数$V_t^s$。
  • 评论家使用$Q_t^s y^s$和$x_t^{s\top} Q_t^s y^s$的$\varepsilon$-近似值$\ell_t^s$与$\rho_t^s$来估计Q值与价值函数。
  • 通过构造一个单动作对手的简化博弈来证明合理性,表明策略更新与最优响应动态一致。
  • 在马尔可夫链可约性等结构假设下,通过归纳法与梯度及价值近似误差的分析建立收敛性。
  • 该算法具有对称性,无偏性(无需知晓对手动作),并仅依赖本地反馈设计用于去中心化执行。

实验结果

研究问题

  • RQ1能否设计一种去中心化算法,在无限时域双人零和马尔可夫博弈中实现最后迭代收敛至纳什均衡?
  • RQ2此类算法是否既能实现合理性(对平稳对手策略的最优响应),又能在自对弈中实现收敛?
  • RQ3在该非凸、非凹设置中,能否同时保持对称性与无偏性,并实现有限时间收敛?
  • RQ4如何将OGDA从矩阵博弈扩展至具有状态相关动态与价值函数的马尔可夫博弈?
  • RQ5缓慢更新的评论家在稳定策略学习与实现收敛中起到何种作用?

主要发现

  • 所提出的算法在无限时域双人零和马尔可夫博弈的自对弈中,实现了对纳什均衡集合的有限时间最后迭代收敛。
  • 该算法具备合理性:当对手采用平稳策略时,智能体的策略会收敛至最优响应。
  • 该算法具有对称性、无偏性与去中心化特性——无需全局协调或知晓对手动作。
  • 评论家的缓慢更新确保了稳定性,且收敛速率取决于梯度与价值近似误差。
  • 分析表明,该算法的收敛性在马尔可夫链由平稳策略诱导出的可约性等结构假设下具有鲁棒性。
  • 这是首个在该设置中同时满足合理性、最后迭代收敛性、无偏性与对称性的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。