Skip to main content
QUICK REVIEW

[论文解读] Finite-Sample Analysis of Decentralized Q-Learning for Stochastic Games

Zuguang Gao, Qianqian Ma|arXiv (Cornell University)|Dec 15, 2021
Auction Theory and Applications被引用 4
一句话总结

本文为弱循环随机博弈中的去中心化Q-learning提供了有限样本收敛保证,建立了表格形式和线性函数逼近设置下的样本复杂度边界。引入了一种类线性逼近均衡的新概念,并在温和条件下证明了去中心化Q-learning以高概率收敛至该均衡,将先前的渐近结果扩展至非渐近范式。

ABSTRACT

Learning in stochastic games is arguably the most standard and fundamental setting in multi-agent reinforcement learning (MARL). In this paper, we consider decentralized MARL in stochastic games in the non-asymptotic regime. In particular, we establish the finite-sample complexity of fully decentralized Q-learning algorithms in a significant class of general-sum stochastic games (SGs) - weakly acyclic SGs, which includes the common cooperative MARL setting with an identical reward to all agents (a Markov team problem) as a special case. We focus on the practical while challenging setting of fully decentralized MARL, where neither the rewards nor the actions of other agents can be observed by each agent. In fact, each agent is completely oblivious to the presence of other decision makers. Both the tabular and the linear function approximation cases have been considered. In the tabular setting, we analyze the sample complexity for the decentralized Q-learning algorithm to converge to a Markov perfect equilibrium (Nash equilibrium). With linear function approximation, the results are for convergence to a linear approximated equilibrium - a new notion of equilibrium that we propose - which describes that each agent's policy is a best reply (to other agents) within a linear space. Numerical experiments are also provided for both settings to demonstrate the results.

研究动机与目标

  • 弥合去中心化多智能体强化学习中渐近收敛与有限样本性能之间的差距。
  • 分析一般和博弈中去中心化Q-learning的样本复杂度,特别是弱循环博弈的情形。
  • 将收敛保证扩展至线性函数逼近设置,其中无法保证完整Q-函数的恢复。
  • 引入并形式化‘线性逼近均衡’的概念,作为在函数逼近下对马尔可夫完美均衡的实际替代方案。
  • 为混合时间与平稳分布最小概率提供显式、与博弈参数相关的边界,使理论结果更具可操作性。

提出的方法

  • 提出一种完全去中心化的Q-learning算法(算法1),其中每个智能体仅使用自身观测和本地更新进行学习,无需观测其他智能体的动作或奖励。
  • 引入一种新的均衡概念——‘线性逼近均衡’,即每个智能体的策略在其特征的线性函数空间内是最优响应。
  • 采用双时标更新规则并使用时变学习率以确保收敛,其中Q值估计基于自举回报进行更新。
  • 采用一种新颖的分析框架,对访问非均衡策略的最小概率以及由联合策略诱导的马尔可夫链的混合时间进行上界估计。
  • 利用最小贝尔曼误差作为关键度量,推导出策略更新概率和收敛至均衡的闭式下界。
  • 将分析扩展至线性函数逼近(算法2),在适当的学率调度下,证明了算法以高概率收敛至线性逼近均衡。

实验结果

研究问题

  • RQ1在弱循环随机博弈中,去中心化Q-learning的有限样本复杂度是多少?其如何依赖于博弈参数?
  • RQ2在存在线性函数逼近的情况下,如何保证收敛?此时真实Q-函数可能无法被表示。
  • RQ3在线性逼近均衡与经典马尔可夫完美均衡之间存在何种关系?
  • RQ4混合时间与最小平稳分布概率如何影响去中心化MARL中的收敛速度?
  • RQ5能否为混合时间与平稳分布等关键量提供显式、与博弈参数相关的边界,以使理论结果更具实用性?

主要发现

  • 本文建立了在表格形式弱循环随机博弈中,去中心化Q-learning收敛至马尔可夫完美均衡的有限样本收敛性,并给出了所需步数的显式边界。
  • 在线性函数逼近情形下,算法在温和条件下收敛至‘线性逼近均衡’——一种新提出的均衡概念,即每个智能体的策略在其线性函数空间内是最优的。
  • 收敛速度依赖于联合策略马尔可夫链的混合时间与最小平稳分布概率,这两者均通过命题2以博弈参数为基准进行了有界化。
  • 该分析提供了策略更新概率与收敛至均衡概率的闭式下界,这是以往渐近分析中所不具备的。
  • 数值实验表明,随着回合数K和每回合步数T的增加,策略停留在均衡附近的占比也随之提高。
  • 结果表明,即使特征集有限,当特征空间足够丰富时,线性逼近均衡仍可与真实马尔可夫完美均衡高度一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。