[论文解读] From Few to More: Large-scale Dynamic Multiagent Curriculum Learning
本文提出动态多智能体课程学习(DyMA-CL),一种新颖的框架,通过在大规模多智能体系统中逐步增加智能体数量来训练智能体。通过引入三种迁移机制——缓存重用、课程蒸馏和模型重载,以及一种动态智能体数量网络(DyAN)以处理可变输入规模,DyMA-CL在StarCraft II和MAgent环境中的深度强化学习最先进方法上显著提升了学习效率与性能。
A lot of efforts have been devoted to investigating how agents can learn effectively and achieve coordination in multiagent systems. However, it is still challenging in large-scale multiagent settings due to the complex dynamics between the environment and agents and the explosion of state-action space. In this paper, we design a novel Dynamic Multiagent Curriculum Learning (DyMA-CL) to solve large-scale problems by starting from learning on a multiagent scenario with a small size and progressively increasing the number of agents. We propose three transfer mechanisms across curricula to accelerate the learning process. Moreover, due to the fact that the state dimension varies across curricula,, and existing network structures cannot be applied in such a transfer setting since their network input sizes are fixed. Therefore, we design a novel network structure called Dynamic Agent-number Network (DyAN) to handle the dynamic size of the network input. Experimental results show that DyMA-CL using DyAN greatly improves the performance of large-scale multiagent learning compared with state-of-the-art deep reinforcement learning approaches. We also investigate the influence of three transfer mechanisms across curricula through extensive simulations.
研究动机与目标
- 解决大规模多智能体系统中状态-动作空间和环境动态随智能体数量呈指数增长的训练挑战。
- 通过实现不同智能体数量下的动态输入规模适应,克服固定输入神经网络在课程学习中的局限性。
- 通过在逐步复杂的训练课程中结构化地传递知识,加速多智能体强化学习。
- 设计并验证一种可扩展的、动态的课程训练范式,以提升复杂MAS环境中智能体的协作与性能。
提出的方法
- 提出动态多智能体课程学习(DyMA-CL),从10 vs 10开始,逐步扩展至50 vs 50名智能体,按智能体数量递增的方式训练智能体。
- 引入三种迁移机制:缓存重用(在不同课程间共享经验回放缓冲区)、课程蒸馏(将大课程的知识蒸馏到小课程)和模型重载(使用预训练模型重新初始化)。
- 设计动态智能体数量网络(DyAN),一种基于图神经网络的架构,通过自适应不同数量的智能体来动态处理可变输入规模。
- 采用一种课程调度,依次经过五个不同任务,每个任务对应不同数量的智能体,以逐步提升训练复杂度。
- 将DyMA-CL应用于两个基准环境:StarCraft II(即时战略游戏)和MAgent(可支持数百万智能体的大规模多智能体仿真环境)。
- 使用独立深度强化学习算法(IQL、PPO、A2C、ACER)在有无课程学习的条件下评估DyMA-CL,以隔离所提框架的影响。
实验结果
研究问题
- RQ1一种逐步增加智能体数量的课程学习方法,是否能显著提升大规模多智能体系统中的学习效率与性能?
- RQ2缓存重用、课程蒸馏和模型重载等迁移机制,在加速收敛与提升最终性能方面效果如何?
- RQ3神经网络架构能否有效适应课程学习中因智能体数量变化而引起的可变输入规模?
- RQ4DyMA-CL在大规模多智能体环境中相较于标准深度强化学习基线方法,性能提升的量化指标是什么?
主要发现
- 在50 vs 50 MAgent场景中,采用模型重载机制的DyMA-CL在A2C算法下显著提升最终性能,平均击杀数达38.25 ± 7.33,平均存活队友数为44.59 ± 9.17。
- 在50 vs 50 StarCraft II场景中,采用模型重载的DyMA-CL在A2C下实现最大击杀数47.71 ± 5.61,平均存活队友数43.77 ± 10.36,优于从零开始训练。
- DyMA-CL带来的性能提升在多种算法中保持一致:IQL、PPO、A2C和ACER在使用课程学习时,平均击杀数与存活率均有所提高。
- 即使在ACER算法中,由于非平稳环境导致策略不稳定,DyMA-CL仍能提升性能,在50 vs 50 MAgent任务中实现9.67 ± 3.68的平均击杀数。
- DyAN网络有效支持了在不同智能体数量的课程间进行学习,克服了固定输入神经架构的局限性。
- 消融实验表明,三种迁移机制——缓存重用、课程蒸馏和模型重载——均对性能提升有贡献,其中模型重载的提升效果最为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。