Skip to main content
QUICK REVIEW

[论文解读] Emergent collective intelligence from massive-agent cooperation and competition

Hanmo Chen, Stone Tao|arXiv (Cornell University)|Jan 4, 2023
Evolutionary Game Theory and Cooperation被引用 4
一句话总结

本文介绍了Lux,一个大规模智能体强化学习环境,用于模拟数千个智能体在有限资源下进行大规模合作与竞争,并对抗黑暗。通过使用基于PPO的集中式像素到像素策略网络,作者展示了无需显式协调即可涌现出集体智能——如协同领土扩张和战略性移动——在与最先进基线方法的对抗中实现了90%的胜率,并能有效泛化至更大地图。

ABSTRACT

Inspired by organisms evolving through cooperation and competition between different populations on Earth, we study the emergence of artificial collective intelligence through massive-agent reinforcement learning. To this end, We propose a new massive-agent reinforcement learning environment, Lux, where dynamic and massive agents in two teams scramble for limited resources and fight off the darkness. In Lux, we build our agents through the standard reinforcement learning algorithm in curriculum learning phases and leverage centralized control via a pixel-to-pixel policy network. As agents co-evolve through self-play, we observe several stages of intelligence, from the acquisition of atomic skills to the development of group strategies. Since these learned group strategies arise from individual decisions without an explicit coordination mechanism, we claim that artificial collective intelligence emerges from massive-agent cooperation and competition. We further analyze the emergence of various learned strategies through metrics and ablation studies, aiming to provide insights for reinforcement learning implementations in massive-agent environments.

研究动机与目标

  • 研究通过大规模智能体合作与竞争涌现出的人工集体智能。
  • 开发一个可扩展的开源环境(Lux),支持在动态、资源匮乏环境中数千个智能体的运行。
  • 探究复杂群体策略是否能从个体智能体决策中自然涌现,而无需显式协调机制。
  • 通过与去中心化方法对比,评估集中式控制在大规模多智能体强化学习中的有效性。

提出的方法

  • 提出Lux,一个网格世界环境,支持每支队伍最多数千个智能体竞争资源并对抗黑暗。
  • 采用集中式控制框架,使用像素到像素策略网络将原始观测映射为动作,规避信用分配问题。
  • 使用课程学习阶段的近端策略优化(PPO)训练智能体,以稳定训练过程。
  • 设计分层特征提取流程:通过三层卷积网络提取地图特征,通过最大池化和全连接层提取单位与城市特征。
  • 实现一种混合观测编码方式,结合全局、自身、单位和城市特征,实现全面的状态表征。
  • 通过消融实验比较集中式与去中心化策略,并评估在不同地图尺寸(12×12至128×128)下的泛化能力。

实验结果

研究问题

  • RQ1在缺乏显式协调机制的情况下,大规模智能体合作与竞争是否能涌现出集体智能?
  • RQ2通过像素到像素策略网络实现的集中式控制,在大规模多智能体环境中如何提升性能与策略涌现?
  • RQ3在小地图上训练的策略在包含数千个智能体的大地图上能多大程度上实现泛化?
  • RQ4课程学习在大规模智能体环境中促进复杂群体策略获取方面起到何种作用?
  • RQ5信用分配与策略架构如何影响多智能体强化学习的可扩展性与性能?

主要发现

  • 集中式像素到像素策略在与Lux AI竞赛中Toad Brigade团队的最先进策略对抗中,取得了90%的胜率。
  • 智能体自发发展出协同策略,如对角线编队移动与领土分割,而无需事先知识或显式协调。
  • 与去中心化策略相比,集中式控制方法在100轮对战中实现了98%的胜率,证明其在协调性与适应性方面更优。
  • 在32×32地图上训练的迁移策略能有效泛化至48×48与64×64地图,维持高水平的智能体协调,即使在超过1,000个单位和CityTiles的情况下。
  • 在128×128地图上,尽管存在模拟速度下降与冷却限制,智能体仍保留了在小地图上学到的核心策略,表明其具备支持百万级智能体的潜力。
  • 消融实验确认,在复杂的大规模场景中,集中式控制显著优于去中心化学习,原因在于其更优的信用分配与更强的战略一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。