Skip to main content
QUICK REVIEW

[论文解读] F2A2: Flexible Fully-decentralized Approximate Actor-critic for Cooperative Multi-agent Reinforcement Learning

Wenhao Li, Bo Jin|arXiv (Cornell University)|Apr 17, 2020
Reinforcement Learning in Robotics参考文献 75被引用 12
一句话总结

F2A2 提出了一种灵活的、完全去中心化的演员-critic 框架,用于合作式多智能体强化学习,实现了无需集中协调的可扩展、稳定训练。通过结合原始-对偶混合梯度下降与参数共享,并利用在线监督学习实现类心智理论的其他智能体建模,F2A2 降低了通信开销并缓解了策略学习中的偏差,在 StarCraft II 和多智能体粒子环境中的表现与集中式和去中心化基线方法相比具有竞争力。

ABSTRACT

Traditional centralized multi-agent reinforcement learning (MARL) algorithms are sometimes unpractical in complicated applications, due to non-interactivity between agents, curse of dimensionality and computation complexity. Hence, several decentralized MARL algorithms are motivated. However, existing decentralized methods only handle the fully cooperative setting where massive information needs to be transmitted in training. The block coordinate gradient descent scheme they used for successive independent actor and critic steps can simplify the calculation, but it causes serious bias. In this paper, we propose a flexible fully decentralized actor-critic MARL framework, which can combine most of actor-critic methods, and handle large-scale general cooperative multi-agent setting. A primal-dual hybrid gradient descent type algorithm framework is designed to learn individual agents separately for decentralization. From the perspective of each agent, policy improvement and value evaluation are jointly optimized, which can stabilize multi-agent policy learning. Furthermore, our framework can achieve scalability and stability for large-scale environment and reduce information transmission, by the parameter sharing mechanism and a novel modeling-other-agents methods based on theory-of-mind and online supervised learning. Sufficient experiments in cooperative Multi-agent Particle Environment and StarCraft II show that our decentralized MARL instantiation algorithms perform competitively against conventional centralized and decentralized methods.

研究动机与目标

  • 解决集中式训练在多智能体强化学习中的局限性,包括可扩展性问题和通信瓶颈。
  • 通过为每个智能体实现联合策略与价值函数优化,克服现有去中心化 MARL 方法中由块坐标下降引入的偏差。
  • 设计一种完全去中心化的框架,支持大规模合作式多智能体场景,同时最小化信息交换。
  • 在智能体具有私有目标且可观测性有限的合作部分可观察随机博弈(POSGs)中,提升稳定性和可扩展性。
  • 在不依赖集中式控制器或全局状态信息的前提下,实现有效的多智能体策略学习。

提出的方法

  • 采用原始-对偶混合梯度下降框架,以去中心化方式联合优化每个智能体的策略(演员)与价值函数(评论家)。
  • 使用有限记忆压缩与单层 LSTM 近似信念状态,实现对其他智能体行为的紧凑表示。
  • 提出一种基于心智理论与在线监督学习的新型其他智能体建模方法,无需直接观测即可推断其他智能体的策略。
  • 在智能体之间应用参数共享,以降低模型复杂度与通信开销。
  • 设计一种灵活的架构,可集成多种演员-critic 方法,提升兼容性与可扩展性。
  • 实施去中心化训练与执行(DTDE)范式,消除对中心控制器的依赖。

实验结果

研究问题

  • RQ1完全去中心化的演员-critic 框架是否能在无集中协调的情况下,在合作式 MARL 中实现具有竞争力的性能?
  • RQ2如何通过联合优化减少去中心化 MARL 中由顺序演员-critic 更新引入的偏差?
  • RQ3参数共享与类心智理论建模在多大程度上可减少通信开销并提升可扩展性?
  • RQ4基于单层 LSTM 的策略是否能有效近似部分可观察环境中的多层信念?
  • RQ5所提出的框架在具有私有目标的大规模合作环境中表现如何?

主要发现

  • F2A2 在 StarCraft II 和多智能体粒子环境中的表现具有竞争力,关键指标上优于或匹配集中式与去中心化基线方法。
  • 通过参数共享与对其他智能体的在线建模,该框架显著减少了信息传输,提升了通信效率。
  • 通过原始-对偶方法联合优化策略与价值函数,稳定了训练过程,并缓解了块坐标下降方案中固有的偏差。
  • 采用类心智理论的建模方法使智能体能够有效推断其他智能体的行为,即使在可观测性有限的情况下也能增强协调能力。
  • 实验结果表明,F2A2 在大规模合作场景中保持了稳定性和可扩展性,在多种环境中表现出强鲁棒性。
  • 尽管仅使用单层 LSTM,该框架仍实现了优异性能,表明在实践中有限信念层级可被有效近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。