Skip to main content
QUICK REVIEW

[论文解读] On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning

Weichao Mao, Lin F. Yang|arXiv (Cornell University)|Oct 12, 2021
Advanced Bandit Algorithms Research被引用 5
一句话总结

本文提出了一种去中心化的、无需环境模型的多智能体强化学习算法,通过在无集中协调的情况下高效学习相关均衡与纳什均衡,克服了多智能体的灾难问题。针对一般和博弈的马尔可夫博弈,提出了一种基于阶段的V-learning方法;针对势博弈,提出了一种基于动量的方差缩减独立策略梯度方法,实现了粗相关均衡的样本复杂度界为$\widetilde{O}(H^5 S A_{\text{max}} / \varepsilon^2)$,以及纳什均衡的样本复杂度界为$\widetilde{O}(1/\varepsilon^4)$。

ABSTRACT

Multi-agent reinforcement learning (MARL) algorithms often suffer from an exponential sample complexity dependence on the number of agents, a phenomenon known as \emph{the curse of multiagents}. In this paper, we address this challenge by investigating sample-efficient model-free algorithms in \emph{decentralized} MARL, and aim to improve existing algorithms along this line. For learning (coarse) correlated equilibria in general-sum Markov games, we propose \emph{stage-based} V-learning algorithms that significantly simplify the algorithmic design and analysis of recent works, and circumvent a rather complicated no-\emph{weighted}-regret bandit subroutine. For learning Nash equilibria in Markov potential games, we propose an independent policy gradient algorithm with a decentralized momentum-based variance reduction technique. All our algorithms are decentralized in that each agent can make decisions based on only its local information. Neither communication nor centralized coordination is required during learning, leading to a natural generalization to a large number of agents. We also provide numerical simulations to corroborate our theoretical findings.

研究动机与目标

  • 解决去中心化多智能体强化学习中的多智能体灾难问题,即联合动作空间随智能体数量呈指数级增长。
  • 设计样本高效、无需模型的算法,学习过程中无需集中协调或通信。
  • 为一般和博弈的马尔可夫博弈中学习粗相关均衡,以及势博弈中学习纳什均衡,提供理论收敛保证。
  • 通过引入新型基于阶段的V-learning框架,简化算法设计,替代复杂的后悔最小化子程序。
  • 在模拟环境中展示所提算法在性能上优于独立学习和基线方法。

提出的方法

  • 为一般和博弈的马尔可夫博弈提出一种基于阶段的V-learning算法,避免使用复杂无加权后悔的多臂赌博机子程序。
  • 为马尔可夫势博弈引入一种独立策略梯度方法,结合去中心化的基于动量的方差缩减技术。
  • 确保完全去中心化:每个智能体仅使用本地信息(本地动作、奖励和价值估计),无需通信或协调。
  • 采用乐观价值函数估计,并通过参数$\gamma_i$实现隐式探索,以在V-learning中促进充分探索。
  • 在集中式基准中应用Hoeffding置信区间和UCB-ADVANTAGE风格的更新,用于性能对比。
  • 实现算法时采用自适应步长$\eta_i$和动量参数$a_t$,以优化收敛性和稳定性。

实验结果

研究问题

  • RQ1我们能否设计一种更简单、更高效的无模型算法,用于在不依赖复杂后悔最小化子程序的前提下,学习一般和博弈马尔可夫博弈中的粗相关均衡?
  • RQ2在无通信、去中心化的设置下,如何实现马尔可夫势博弈中纳什均衡的样本高效学习?
  • RQ3去中心化、无模型的多智能体强化学习算法在大规模多智能体系统中学习均衡的理论样本复杂度是多少?
  • RQ4在具有策略互动的多智能体环境中,去中心化算法在多大程度上优于朴素的独立学习?
  • RQ5理论样本复杂度边界与实际性能相比如何,特别是在收敛速度和最终性能方面?

主要发现

  • 基于阶段的V-learning算法在一般和博弈马尔可夫博弈中,实现$\widetilde{O}(H^5 S A_{\text{max}} / \varepsilon^2)$的样本复杂度,用于学习$\varepsilon$-近似粗相关均衡。
  • 对于马尔可夫势博弈,结合动量的方差缩减独立策略梯度方法,实现$\widetilde{O}(1/\varepsilon^4)$的样本复杂度,用于学习$\varepsilon$-近似纳什均衡。
  • 数值模拟表明,两种所提算法均优于独立Q-learning基线方法,并在GoodState和BoxPushing任务中接近集中式基准的性能。
  • 实际训练中,算法收敛速度远快于理论边界预测,表明理论样本复杂度边界可能过于保守。
  • 所提出的去中心化动量基方差缩减技术能有效稳定训练过程,并提升势博弈中策略梯度方法的收敛性。
  • 所提方法完全去中心化,无需通信或集中协调,因此可扩展至大量智能体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。