[论文解读] Learning to Communicate Using Counterfactual Reasoning
本文提出了一种新型多智能体强化学习方法——MACC(多智能体反事实通信),通过在集中式评论者中使用反事实推理来解决通信学习中的信用分配问题。通过建模动作和消息的反事实影响并引入社交损失函数,MACC 使智能体能够学习到有效且可影响的通信协议,在四个粒子环境场景中优于 COMA 和 MADDPG,并在最多六名智能体的矩阵环境中展现出良好的可扩展性。
Learning to communicate in order to share state information is an active problem in the area of multi-agent reinforcement learning (MARL). The credit assignment problem, the non-stationarity of the communication environment and the creation of influenceable agents are major challenges within this research field which need to be overcome in order to learn a valid communication protocol. This paper introduces the novel multi-agent counterfactual communication learning (MACC) method which adapts counterfactual reasoning in order to overcome the credit assignment problem for communicating agents. Secondly, the non-stationarity of the communication environment while learning the communication Q-function is overcome by creating the communication Q-function using the action policy of the other agents and the Q-function of the action environment. Additionally, a social loss function is introduced in order to create influenceable agents which is required to learn a valid communication protocol. Our experiments show that MACC is able to outperform the state-of-the-art baselines in four different scenarios in the Particle environment.
研究动机与目标
- 为解决多智能体通信学习中的信用分配问题,即智能体难以将奖励归因于单个动作或消息。
- 通过使用其他智能体的策略和环境 Q 函数,缓解通信 Q 函数学习过程中环境的非平稳性。
- 通过引入社交损失函数,确保接收智能体受到传入消息的影响,从而促进社会行为。
- 为提升大规模多智能体系统中的可扩展性,开发精确反事实计算的计算高效近似方法。
- 在包括多对多设置在内的多样化通信拓扑中,验证该方法在性能和可扩展性方面的表现。
提出的方法
- MACC 使用集中式评论者计算动作和消息的反事实值,实现在合作式 MARL 中的精确信用分配。
- 通信 Q 函数通过其他智能体的策略和环境的 Q 函数构建,从而在训练过程中降低非平稳性。
- 提出两种近似方法——MACC 采样均值和 MACC 基于智能体的采样,以降低计算成本,同时保持性能。
- 引入社交损失函数,鼓励接收智能体受消息影响,从而实现有效通信协议的学习。
- 该方法遵循 CTDE(集中式训练,去中心化执行)范式,允许在训练期间进行集中式计算,同时保持推理的去中心化。
- 在对称环境中,通过共享参数的独立策略评估 MACC 变体,提升可扩展性。
实验结果
研究问题
- RQ1在集中式评论者中使用反事实推理,是否能有效改善多智能体系统中动作策略和通信策略的信用分配?
- RQ2反事实计算的近似方法在大规模多智能体设置中如何影响学习性能与可扩展性?
- RQ3社交损失函数是否能有效促进接收智能体的可影响性,从而促成有效通信协议的出现?
- RQ4在多样化通信场景中,MACC 相较于 COMA 和 MADDPG 等先进方法表现如何?
- RQ5MACC 在复杂多对多通信拓扑中,能够扩展到多大规模的多智能体系统?
主要发现
- MACC 变体在所有四个粒子环境场景中均优于 COMA 和 MADDPG,实现更高的平均奖励和更快的收敛速度。
- 在包含 2、4 和 6 名智能体的矩阵环境中,MACC Exact 和 MACC 基于智能体采样均取得最高奖励,展现出强大的可扩展性。
- MACC 采样均值因随机采样导致方差较高且收敛更慢,尤其在智能体数量增加时更为明显。
- 社交损失函数至关重要:若不使用社交损失,MACC Exact 的奖励仅略高于 0.5,表明仅学习到基础通信协议;而完整版本的 MACC 达到接近最优性能。
- 在较大规模设置中,MACC 基于智能体采样略优于 MACC 采样均值,表明其在高维智能体空间中具有更好的方差控制能力。
- 精确的 MACC 方法即使在六名智能体的情况下仍保持高性能,证实其在复杂、可扩展的多智能体通信系统中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。