Skip to main content
QUICK REVIEW

[论文解读] Learning to Share in Multi-Agent Reinforcement Learning

Yuxuan Yi, Ge Li|arXiv (Cornell University)|Dec 16, 2021
Evolutionary Game Theory and Cooperation被引用 6
一句话总结

该论文提出LToS,一种分层去中心化的多智能体强化学习框架,使智能体能够与邻居动态共享奖励,从而在联网多智能体强化学习中提升合作能力。通过将全局目标分解(高层策略)与本地策略优化(低层策略)解耦,LToS在社交困境和大规模交通控制场景中均优于现有方法(QMIX、DGN、NeurComm),在收敛性和全局回报方面表现更优。

ABSTRACT

In this paper, we study the problem of networked multi-agent reinforcement learning (MARL), where a number of agents are deployed as a partially connected network and each interacts only with nearby agents. Networked MARL requires all agents to make decisions in a decentralized manner to optimize a global objective with restricted communication between neighbors over the network. Inspired by the fact that sharing plays a key role in human's learning of cooperation, we propose LToS, a hierarchically decentralized MARL framework that enables agents to learn to dynamically share reward with neighbors so as to encourage agents to cooperate on the global objective through collectives. For each agent, the high-level policy learns how to share reward with neighbors to decompose the global objective, while the low-level policy learns to optimize the local objective induced by the high-level policies in the neighborhood. The two policies form a bi-level optimization and learn alternately. We empirically demonstrate that LToS outperforms existing methods in both social dilemma and networked MARL scenarios across scales.

研究动机与目标

  • 解决在仅与邻居通信的大规模、部分连接的多智能体网络中去中心化合作的挑战。
  • 克服现有集中训练/去中心化执行(CTDE)方法因过度泛化和可扩展性差而带来的局限性。
  • 开发一种机制,使智能体能够动态学习如何共享奖励,以促进全局目标的集体优化。
  • 消除对人工设计的奖励函数或全局状态访问的依赖,这些在先前工作中较为常见。
  • 实现可扩展的去中心化训练,采用双层策略结构,支持在动态环境中实现动态协调。

提出的方法

  • 提出一种双层分层框架:高层策略学习如何与邻居共享奖励,以分解全局目标。
  • 低层策略优化由高层奖励共享决策在邻域内诱导出的本地目标。
  • 通过双层优化过程交替训练高层策略与低层策略。
  • 高层策略在理论上被证明是联合高层策略的平均场近似,确保稳定性。
  • 使用DDPG实现高层策略,DGN实现低层策略,但该框架可推广至其他强化学习算法。
  • 通过网络上的消息传递实现本地信息交换,支持无需全局状态访问的去中心化执行。

实验结果

研究问题

  • RQ1去中心化的多智能体强化学习框架能否学习动态共享奖励,以提升联网环境中的全局合作?
  • RQ2通过高层策略学习奖励共享是否优于在社交困境中使用固定或人工设计的奖励重塑方法?
  • RQ3所提出的双层框架能否在大规模、部分连接的网络(如交通信号控制体系)中有效扩展?
  • RQ4动态奖励共享机制与集中式或固定结构的信用分配及奖励重塑方法相比有何差异?
  • RQ5高层策略在动态环境变化(如高峰交通时段)下自适应调整共享权重的能力在多大程度上提升了协调能力?

主要发现

  • 在CityFlow交通仿真中,LToS在6×6网格网络中将每辆车的平均红灯数量从QMIX的5.94降低至0.58,优于DGN、QMIX、NeurComm和ConseNet。
  • 在包含33个交叉路口的真实深圳交通网络中,LToS将每辆车的平均等待时间减少至1.71个红灯,而DQN为13.99,DGN为2.02。
  • 消融实验表明,固定共享权重(固定LToS)在动态环境中表现较差,证明高层策略在自适应协调中的必要性。
  • LToS在收敛速度和稳定性方面优于IP和LIO,后者存在收敛缓慢和对超参数敏感的问题。
  • 自私行为模式的可视化显示,智能体在高峰时段减少了自私行为,表明高层策略能够根据环境需求动态调整合作水平。
  • 自私行为的空间与时间模式显示,内部智能体在高峰时段表现出更协调的十字形合作模式,证明了复杂、上下文感知协作的涌现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。