Skip to main content
QUICK REVIEW

[论文解读] Neighborhood Cognition Consistent Multi-Agent Reinforcement Learning

Hangyu Mao, Wulong Liu|arXiv (Cornell University)|Dec 3, 2019
Reinforcement Learning in Robotics参考文献 19被引用 6
一句话总结

本文提出了一种新型框架——邻域认知一致性多智能体强化学习(NCC-MARL),通过变分推理共享隐藏认知变量,在邻近智能体之间强制实现认知一致性,从而增强多智能体协作。通过将邻域特定表征与该潜在变量对齐,NCC-Q与NCC-AC在路由、WiFi配置和Google足球任务中均显著优于当前最先进(SOTA)的MARL方法,尤其在环境复杂度增加时表现更优。

ABSTRACT

Social psychology and real experiences show that cognitive consistency plays an important role to keep human society in order: if people have a more consistent cognition about their environments, they are more likely to achieve better cooperation. Meanwhile, only cognitive consistency within a neighborhood matters because humans only interact directly with their neighbors. Inspired by these observations, we take the first step to introduce \emph{neighborhood cognitive consistency} (NCC) into multi-agent reinforcement learning (MARL). Our NCC design is quite general and can be easily combined with existing MARL methods. As examples, we propose neighborhood cognition consistent deep Q-learning and Actor-Critic to facilitate large-scale multi-agent cooperations. Extensive experiments on several challenging tasks (i.e., packet routing, wifi configuration, and Google football player control) justify the superior performance of our methods compared with state-of-the-art MARL approaches.

研究动机与目标

  • 为解决多智能体强化学习中因智能体感知不一致而阻碍有效协作的挑战。
  • 开发一种可扩展的、基于局部的协调机制,以补充现有MARL中的全局协调方法。
  • 将智能体邻域内的认知一致性形式化为实现鲁棒、大规模多智能体协作的关键机制。
  • 设计一种可泛化的通用方法,可与现有MARL算法(如DQN和Actor-Critic)集成。
  • 通过实证验证,邻域认知一致性可提升样本效率与性能,尤其在复杂环境中表现更优。

提出的方法

  • 该方法将多智能体环境建模为图结构,其中智能体为节点,交互关系构成边。
  • 图卷积网络(GCN)处理邻近智能体的联合观测,以提取高层表征。
  • 该表征被分解为智能体特定与邻域特定的认知表征。
  • 引入基于变分推理的CD损失,将每个智能体的邻域表征与该邻域的共享真实隐藏认知变量对齐。
  • CD损失促使邻近智能体对其局部环境形成一致的认知,从而实现协调但个性化的策略。
  • 该框架被集成至深度Q学习(NCC-Q)与Actor-Critic(NCC-AC)中,实现可扩展性与与现有MARL架构的兼容性。

实验结果

研究问题

  • RQ1在复杂、大规模环境中,强制实现局部邻域内的认知一致性是否能提升多智能体协作能力?
  • RQ2与集中式评论家或值因子分解等全局协调机制相比,邻域认知一致性在性能与可扩展性方面表现如何?
  • RQ3所提出的CD损失在多大程度上加速了智能体一致认知的形成并提升了学习效率?
  • RQ4认知一致性是否与团队整体性能正相关,尤其在高环境复杂度下?
  • RQ5该方法能否在多种现实场景(如数据包路由、WiFi配置与体育控制)中实现泛化?

主要发现

  • NCC-Q与NCC-AC在数据包路由、WiFi配置与Google足球任务中显著优于当前最先进MARL方法(包括VDN与QMIX)。
  • 在2v2 Google足球场景中,NCC-Q的平均奖励高于Graph-Q与GCC-Q,证明了邻域认知一致性机制的有效性。
  • 消融实验表明,结合TD损失与CD损失可实现更快收敛与更一致的认知值,尤其在高难度设置下表现更优。
  • 在高难度足球场景(game_difficulty=0.9)中,CD损失至关重要——未使用该损失的方法获得极低奖励且认知不一致。
  • 结果表明,认知一致性与团队性能之间存在强烈正相关关系,一致的邻域结构可实现更优协作。
  • 该方法在大规模路由任务中表现出良好可扩展性,且随着环境复杂度提升,NCC-MARL的性能增益亦随之增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。