[论文解读] Scalable Multi-Agent Reinforcement Learning through Intelligent Information Aggregation
该论文提出InforMARL,一种基于图神经网络的架构,通过智能聚合局部邻域信息,实现可扩展的、去中心化的多智能体强化学习。其在不同数量智能体下均展现出优越的样本效率和泛化能力,优于依赖全局信息的基线模型,同时仅依赖局部观测即可在导航与协作任务中保持高成功率。
We consider the problem of multi-agent navigation and collision avoidance when observations are limited to the local neighborhood of each agent. We propose InforMARL, a novel architecture for multi-agent reinforcement learning (MARL) which uses local information intelligently to compute paths for all the agents in a decentralized manner. Specifically, InforMARL aggregates information about the local neighborhood of agents for both the actor and the critic using a graph neural network and can be used in conjunction with any standard MARL algorithm. We show that (1) in training, InforMARL has better sample efficiency and performance than baseline approaches, despite using less information, and (2) in testing, it scales well to environments with arbitrary numbers of agents and obstacles. We illustrate these results using four task environments, including one with predetermined goals for each agent, and one in which the agents collectively try to cover all goals. Code available at https://github.com/nsidn98/InforMARL.
研究动机与目标
- 解决在有限局部观测和去中心化执行条件下可扩展的多智能体导航挑战。
- 在不依赖全局状态信息的前提下,提升多智能体强化学习中的样本效率和策略可迁移性。
- 证明智能聚合局部信息可优于基线的全局状态拼接方法。
- 仅使用局部观测,在密集动态环境中实现有效的协作与碰撞避免。
- 表明基于图的信息聚合可显著提升多样化多智能体导航任务中的可扩展性与性能。
提出的方法
- 在多智能体强化学习框架中,为智能体策略网络和评论家网络引入图神经网络(GNN),用于编码和聚合局部邻域信息。
- 将环境表示为图结构,其中智能体和障碍物作为节点,边表示基于距离的关系。
- 利用GNN的消息传递机制,为每个智能体计算上下文感知的、聚合的局部观测表示。
- 将GNN处理后的信息无缝集成至标准MARL算法(如RMAPPO)中,不改变核心训练范式。
- 通过确保每个智能体仅基于其局部观测和聚合的邻域向量进行决策,实现去中心化执行。
- 通过在固定数量智能体上训练并在不同数量下测试,支持策略的可迁移性,无需重新训练。
实验结果
研究问题
- RQ1与全局状态基线相比,智能聚合局部信息是否能提升多智能体强化学习中的样本效率?
- RQ2基于GNN的信息聚合模块是否能实现比标准MARL算法更好的未见智能体数量泛化能力?
- RQ3仅使用局部观测训练的去中心化MARL策略,是否能在复杂协作任务(如覆盖与编队)中实现高性能?
- RQ4仅使用局部信息是否比使用全局状态具有更好的可扩展性与更低的样本复杂度?
- RQ5基于图的表示能否有效识别并利用最相关的环境信息以实现导航与碰撞避免?
主要发现
- InforMARL在所有测试环境(Target、Coverage、Formation、Line)中均实现了100%的成功率,无论使用3个还是7个智能体,即使仅在3个智能体场景下进行训练。
- 在Target环境中,InforMARL在约39%的episode长度内(T ≈ 0.39)成功抵达目标,展现出高效的导航能力。
- 在Coverage与Formation任务中,InforMARL在0.30–0.43的episode长度内完成任务,尽管仅使用局部观测,其性能仍与RMAPPO相当或略优。
- InforMARL在训练过程中展现出优于基线方法的样本效率,尽管其使用的观测信息少于全局状态模型。
- 该方法在不同数量智能体间表现出良好泛化能力,测试7个智能体时性能无下降,证明其可迁移性。
- InforMARL在所有任务中均保持高性能,包括需要目标共识的任务(如Formation、Line),证明其在极简信息下仍能支持复杂协作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。