Skip to main content
QUICK REVIEW

[论文解读] Scalable Multi-Agent Model-Based Reinforcement Learning

Vladimir Egorov, Aleksei Shpilman|arXiv (Cornell University)|May 25, 2022
Software Reliability and Analysis Research被引用 8
一句话总结

该论文提出 MAMBA,一种可扩展的多智能体基于模型强化学习方法,通过智能体间的通信来维护去中心化的世界模型以进行训练,从而实现在无需直接与环境交互的情况下实现样本高效的训练。与最先进(SOTA)的无模型方法相比,MAMBA 将环境交互次数减少了整整一个数量级,同时在 SMAC 和 Flatland 环境的低数据场景下表现优于这些方法。

ABSTRACT

Recent Multi-Agent Reinforcement Learning (MARL) literature has been largely focused on Centralized Training with Decentralized Execution (CTDE) paradigm. CTDE has been a dominant approach for both cooperative and mixed environments due to its capability to efficiently train decentralized policies. While in mixed environments full autonomy of the agents can be a desirable outcome, cooperative environments allow agents to share information to facilitate coordination. Approaches that leverage this technique are usually referred as communication methods, as full autonomy of agents is compromised for better performance. Although communication approaches have shown impressive results, they do not fully leverage this additional information during training phase. In this paper, we propose a new method called MAMBA which utilizes Model-Based Reinforcement Learning (MBRL) to further leverage centralized training in cooperative environments. We argue that communication between agents is enough to sustain a world model for each agent during execution phase while imaginary rollouts can be used for training, removing the necessity to interact with the environment. These properties yield sample efficient algorithm that can scale gracefully with the number of agents. We empirically confirm that MAMBA achieves good performance while reducing the number of interactions with the environment up to an orders of magnitude compared to Model-Free state-of-the-art approaches in challenging domains of SMAC and Flatland.

研究动机与目标

  • 解决无模型多智能体强化学习(MFRL)在合作环境中的样本效率低下问题。
  • 将基于模型的强化学习(MBRL)扩展至任意数量智能体的多智能体设置,同时在执行过程中保持去中心化。
  • 利用通信作为维持世界模型的机制,实现在集中式训练的同时不损害执行阶段的去中心化特性。
  • 通过在学习到的世界模型上进行想象的轨迹采样,提升低数据场景下的样本效率。
  • 在智能体数量不断增加的环境中(如 Flatland 中的 15 个智能体)保持性能的同时实现方法的可扩展性。

提出的方法

  • MAMBA 为每个智能体配备一个世界模型,利用训练期间所有智能体的集中式经验进行训练,从而在无需真实环境交互的情况下实现想象的轨迹采样。
  • 每个智能体通过与邻近智能体交换离散消息,更新其对环境的离散潜在空间表征。
  • 世界模型采用具有离散潜在空间的变分自编码器(VAE)进行训练,支持解耦且可扩展的表征学习。
  • 在训练过程中,策略通过世界模型生成的想象轨迹进行优化,从而减少对真实环境交互的依赖。
  • 在执行阶段,智能体仅使用来自邻居的本地消息来更新其个体世界模型,确保去中心化。
  • 该方法将通信作为世界模型更新机制的核心组成部分,将其视为一种结构化信息共享形式。

实验结果

研究问题

  • RQ1在合作型多智能体环境中,智能体间的通信是否足以支撑训练所需的世界模型?
  • RQ2基于模型的方法是否能在低数据场景下实现优于最先进无模型方法的样本效率?
  • RQ3随着智能体数量的增加,世界模型和通信机制的可扩展性表现如何?
  • RQ4使用集中式世界模型生成的想象轨迹是否能够有效支持策略训练,同时保持执行阶段的去中心化?
  • RQ5在高密度环境(如 15 个智能体的 Flatland)中,是否仅通过邻居的离散消息就能有效训练世界模型?

主要发现

  • 与 SMAC 和 Flatland 中的最先进无模型方法(如 MAPPO)相比,MAMBA 将所需环境交互次数减少了整整一个数量级。
  • 在 SMAC 环境中,MAMBA 在低数据场景下几乎赢得一半的对局,表现优于在相同条件下表现吃力的 MAPPO。
  • 在 5 个智能体的 Flatland 地图中,MAMBA 在 30 万次采样内即达到良好性能,而 1RL 基线需要更多采样才能提升。
  • 在 10 个智能体的 Flatland 设置中,MAMBA 在 100 万次采样后仍优于 1RL,尽管样本效率开始下降。
  • 在 15 个智能体的 Flatland 设置中,尽管受环境复杂性增加的影响样本效率下降,MAMBA 在 150 万次采样后仍达到与 1RL 相当的性能。
  • MAMBA 有效解耦了全局奖励,并在无需额外信用分配技术的情况下表现良好,表明其在合作场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。