[论文解读] Agent-Centric Representations for Multi-Agent Reinforcement Learning
本文提出了一种面向多智能体强化学习(MARL)的智能体中心表征,设计了一种智能体中心注意力模块以实现复杂协作,并提出了一种智能体中心无监督预测目标用于预训练或辅助学习。在Google Research Football和DeepMind Lab 2D环境中的实验表明,这些组件提升了样本效率与泛化能力,并涌现出团队协作策略,其中最佳智能体在公开的GRF排行榜中排名第一。
Object-centric representations have recently enabled significant progress in tackling relational reasoning tasks. By building a strong object-centric inductive bias into neural architectures, recent efforts have improved generalization and data efficiency of machine learning algorithms for these problems. One problem class involving relational reasoning that still remains under-explored is multi-agent reinforcement learning (MARL). Here we investigate whether object-centric representations are also beneficial in the fully cooperative MARL setting. Specifically, we study two ways of incorporating an agent-centric inductive bias into our RL algorithm: 1. Introducing an agent-centric attention module with explicit connections across agents 2. Adding an agent-centric unsupervised predictive objective (i.e. not using action labels), to be used as an auxiliary loss for MARL, or as the basis of a pre-training step. We evaluate these approaches on the Google Research Football environment as well as DeepMind Lab 2D. Empirically, agent-centric representation learning leads to the emergence of more complex cooperation strategies between agents as well as enhanced sample efficiency and generalization.
研究动机与目标
- 探究对象中心归纳偏置(此前在视觉与推理任务中表现成功)是否能提升多智能体强化学习(MARL)的性能。
- 设计并评估一种智能体中心注意力机制,通过在共享策略网络中显式连接分散智能体,以改善协调能力。
- 开发一种智能体中心无监督轨迹预测任务,作为预训练或辅助损失,以增强表征学习,且无需动作标签。
- 评估智能体中心表征对样本效率、泛化能力以及在具有挑战性的MARL环境中涌现协作的影响。
提出的方法
- 引入一种智能体中心注意力模块,该模块在分散智能体的前向传播中间特征上运行,使共享策略网络内实现显式跨智能体通信。
- 采用一种新颖的智能体中心预测目标,仅从观测中预测每个智能体的未来位置,无需动作标签,用于无监督预训练或辅助训练。
- 通过两种微调策略应用预训练模型:权重初始化与类似神经网络渐进结构的冻结列。
- 在完全合作的MARL设置中使用V-trace演员评论家方法,结合策略梯度优化,形式化为多智能体MDP。
- 在基于策略的MARL算法中评估智能体中心注意力模块,这是该模块首次应用于此类设置。
- 将智能体中心预测目标与非智能体中心的“观察全部”基线进行比较,以隔离智能体特定推理的收益。
实验结果
研究问题
- RQ1智能体中心表征是否能提升完全合作多智能体强化学习中的协作与泛化能力?
- RQ2与标准CNN相比,智能体中心注意力机制是否能促使更复杂、协调的策略涌现?
- RQ3智能体中心无监督预测目标能否在无需动作标签的情况下,作为MARL中有效的辅助损失或预训练目标?
- RQ4智能体中心表征学习如何影响多智能体环境中的样本效率与对策略变化的鲁棒性?
- RQ5使用智能体中心目标进行预训练是否能提升泛化能力,还是反而限制了模型适应新对手的能力?
主要发现
- 采用智能体中心注意力的ACNN模型在20场比赛的锦标赛中取得ELO评分为147,显著优于CNN基线(−323评分),证明其泛化能力更强。
- 通过辅助预测损失微调的ACNN智能体取得ELO评分为182,在公开的GRF多智能体联赛排行榜中排名第一,得分为1992。
- 使用智能体中心预测目标进行预训练的智能体比从随机初始化微调的智能体泛化能力更强,表明该方法在表征学习中的有效性。
- 在所有评估设置中,智能体中心预测目标均优于非智能体中心的“观察全部”基线,证实了智能体特定推理的重要性。
- 在内置AI策略下训练的智能体表现脆弱,面对更强对手时表现不佳;而通过自对弈AI训练的智能体展现出强大泛化能力,并在公开排行榜中位列榜首。
- 从零开始训练的ACNN模型泛化能力优于预训练变体,表明尽管预训练可加速收敛,但可能限制探索能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。