[论文解读] Collaboration of AI Agents via Cooperative Multi-Agent Deep Reinforcement Learning
本文提出了一种协作式多智能体深度强化学习方法——具体包括参数共享、带通信的协同学习,以及反事实策略梯度——以训练人工智能智能体在网格足球中协同合作。带通信的协同学习方法表现最佳,在对阵人工编码团队时成功得分率达94.5%,在对抗性训练中成功得分为75%,相较于其他方法展现出更优的适应性与团队协作能力。
There are many AI tasks involving multiple interacting agents where agents should learn to cooperate and collaborate to effectively perform the task. Here we develop and evaluate various multi-agent protocols to train agents to collaborate with teammates in grid soccer. We train and evaluate our multi-agent methods against a team operating with a smart hand-coded policy. As a baseline, we train agents concurrently and independently, with no communication. Our collaborative protocols were parameter sharing, coordinated learning with communication, and counterfactual policy gradients. Against the hand-coded team, the team trained with parameter sharing and the team trained with coordinated learning performed the best, scoring on 89.5% and 94.5% of episodes respectively when playing against the hand-coded team. Against the parameter sharing team, with adversarial training the coordinated learning team scored on 75% of the episodes, indicating it is the most adaptable of our methods. The insights gained from our work can be applied to other domains where multi-agent collaboration could be beneficial.
研究动机与目标
- 开发并评估多智能体强化学习协议,以实现在协作任务中AI智能体之间的有效协作。
- 在网格足球环境中,将去中心化方法——参数共享、带通信的协同学习、反事实策略梯度——与强基准的人工编码基线进行对比。
- 评估这些方法在对抗性训练条件下的适应性、泛化能力与性能表现。
- 识别哪种方法在多智能体协作中最佳平衡专业化、通信与鲁棒性。
提出的方法
- 在10×18网格上的三名队员团队环境中,使用深度Q网络(DQN)结合经验回放与目标网络,在网格足球模拟器中训练智能体。
- 实施参数共享,所有智能体共享同一策略网络,实现无需显式通信的联合学习。
- 应用带通信的协同学习,智能体共享观测与动作以形成联合状态表征,提升协作效率。
- 采用反事实策略梯度(COMA),通过集中式价值函数计算并利用反事实优势函数为个体动作分配信用。
- 使用集中式评论家网络估算联合动作的Q值,实现在保持去中心化策略的同时完成信用分配。
- 基于反事实优势执行优势驱动的策略更新:$ A^a(s, \mathbf{u}) = Q(s, \mathbf{u}) - \sum_{u^{\prime a}} \pi^a(u^{\prime a}|\tau^a) Q(s, (\mathbf{u}^{-a}, u^{\prime a})) $。
实验结果
研究问题
- RQ1在训练协作式智能体参与协作类游戏(如网格足球)时,不同多智能体深度强化学习方法的性能表现如何比较?
- RQ2在协作任务中,具备通信机制或信用分配机制的去中心化方法是否能超越独立学习或参数共享方法?
- RQ3在稳定性、适应性与最终性能方面,带通信的协同学习方法与反事实策略梯度方法相比表现如何?
- RQ4经过带通信协同学习训练的团队,在对抗性训练场景中,其适应能力与超越其他学习团队的能力达到何种程度?
主要发现
- 带通信的协同学习方法在对阵人工编码团队时,得分率达到94.5%,优于所有其他方法。
- 在对抗性训练中,该方法对阵参数共享团队时在75%的对局中成功得分,表明其具备强大的适应性与鲁棒性。
- 并行学习方法表现差,一名智能体主导了所有角色,其他智能体学习甚少,导致协作程度极低。
- 反事实策略梯度方法收敛迅速,但陷入局部最优,仅专注于进攻而忽略防守。
- 参数共享方法虽接近完美性能,但在训练过程中表现出轻微不稳定性,性能随时间波动。
- 带通信的协同学习方法学习速度最慢,但能稳定收敛至接近最优性能,展现出更优的长期学习与协作能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。