[论文解读] Scalable Centralized Deep Multi-Agent Reinforcement Learning via Policy Gradients
本文提出DIMAPG,一种可扩展的集中式深度多智能体强化学习算法,通过使用分布式策略梯度优化在所有智能体之间训练单一共享策略。通过假设智能体策略在参数空间中相近,该方法能高效学习协作与竞争任务中的联合行为,在智能体数量增加时,性能优于MADDPG和集中式'厨房水槽'方法等基线方法。
In this paper, we explore using deep reinforcement learning for problems with multiple agents. Most existing methods for deep multi-agent reinforcement learning consider only a small number of agents. When the number of agents increases, the dimensionality of the input and control spaces increase as well, and these methods do not scale well. To address this, we propose casting the multi-agent reinforcement learning problem as a distributed optimization problem. Our algorithm assumes that for multi-agent settings, policies of individual agents in a given population live close to each other in parameter space and can be approximated by a single policy. With this simple assumption, we show our algorithm to be extremely effective for reinforcement learning in multi-agent settings. We demonstrate its effectiveness against existing comparable approaches on co-operative and competitive tasks.
研究动机与目标
- 解决现有深度多智能体强化学习(MARL)方法在智能体数量增加时的可扩展性限制。
- 克服高智能体数量下去中心化MARL框架中的维度灾难与样本效率低下问题。
- 通过集中式经验与分布式优化训练单一共享策略,实现在大规模多智能体系统中的有效学习。
- 在协作导航、捕食者-猎物和生存任务中,与最先进基线方法相比,展示在智能体数量增加时的优越性能。
提出的方法
- 将MARL问题建模为分布式优化任务,其中每个智能体使用本地梯度改进共享中心策略。
- 使用集中式评论家计算联合状态-动作值,并反向传播梯度以更新共享策略参数。
- 应用策略梯度更新,使每个智能体的本地策略适应信息指导中心策略更新,保持智能体间的一致性。
- 近似二阶梯度以高效地优化策略更新,尽管存在计算权衡。
- 为所有智能体训练单一共享策略,假设其在参数空间中相近,从而实现涌现的集体行为。
- 在推理阶段统一部署训练好的策略至所有智能体,确保对称性与可扩展性。
实验结果
研究问题
- RQ1通过分布式优化训练的单一共享策略是否能有效扩展至大规模多智能体环境?
- RQ2在智能体数量增加的协作与竞争任务中,所提方法与去中心化及集中式基线方法相比性能如何?
- RQ3假设智能体策略在参数空间中相近,是否能实现大规模MARL中的有效泛化与样本效率?
- RQ4具有共享策略学习的集中式框架在多智能体设置中,能在多大程度上超越独立策略训练?
- RQ5该方法在具有复杂交互的多智能体环境中,如何处理非平稳性与信用分配问题?
主要发现
- DIMAPG在最多10个智能体的协作导航任务中成功学习到有效策略,且仅DIMAPG能快速收敛。
- 在12对1和3对1的捕食者-猎物游戏中,DIMAPG获得的平均捕食者奖励高于MADDPG和集中式'厨房水槽'方法,尤其在速度差异增大时表现更优。
- 在630个智能体的生存任务中,DIMAPG每局平均获得674分奖励,有490名幸存者且无剩余食物,表明其具备有效的协调与生存策略。
- 在N=230名智能体的情况下,平均奖励达946分,227名幸存者且无剩余食物,表明智能体学会协作并收集食物而不具攻击性。
- 该方法优于单智能体微调与独立策略训练,证实共享策略学习比独立适应更有效。
- 验证了策略在参数空间中相近的假设:共享策略θ与k-shot微调策略θ’的性能几乎完全相同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。