Skip to main content
QUICK REVIEW

[论文解读] Towards Efficient Multi-Agent Learning Systems

Kailash Gogineni, Wei Peng|arXiv (Cornell University)|May 22, 2023
Data Stream Mining Techniques被引用 4
一句话总结

本文提出了一种局部感知邻居采样策略,以优化多智能体强化学习(MARL)中计算密集型的小批量采样阶段,显著提升了缓存效率。该方法在12个智能体的MARL工作负载上,将采样时间减少26.66–27.39%,端到端训练时间减少10.2%,且未降低平均奖励,展示了面向可扩展MARL训练的关键系统级优化。

ABSTRACT

Multi-Agent Reinforcement Learning (MARL) is an increasingly important research field that can model and control multiple large-scale autonomous systems. Despite its achievements, existing multi-agent learning methods typically involve expensive computations in terms of training time and power arising from large observation-action space and a huge number of training steps. Therefore, a key challenge is understanding and characterizing the computationally intensive functions in several popular classes of MARL algorithms during their training phases. Our preliminary experiments reveal new insights into the key modules of MARL algorithms that limit the adoption of MARL in real-world systems. We explore neighbor sampling strategy to improve cache locality and observe performance improvement ranging from 26.66% (3 agents) to 27.39% (12 agents) during the computationally intensive mini-batch sampling phase. Additionally, we demonstrate that improving the locality leads to an end-to-end training time reduction of 10.2% (for 12 agents) compared to existing multi-agent algorithms without significant degradation in the mean reward.

研究动机与目标

  • 从系统角度识别并分析多智能体强化学习(MARL)训练中的性能瓶颈。
  • 理解关键MARL训练阶段(尤其是小批量采样和更新阶段)的计算强度。
  • 通过在采样阶段优化内存局部性,提升MARL中的数据访问效率。
  • 在不牺牲学习性能的前提下,减少MARL的端到端训练时间。
  • 通过解决随智能体数量增长带来的可扩展性问题,推动MARL在更广泛现实场景中的部署。

提出的方法

  • 提出一种邻居采样策略,通过重排经验回放缓冲区中的转移数据,以改善空间和时间局部性。
  • 在小批量采样过程中,应用局部感知索引,将来自相邻智能体的转移数据聚集在一起。
  • 将优化后的采样循环以最小的架构改动集成到现有的MARL框架(MADDPG和MASAC)中。
  • 使用硬件性能计数器对GPU架构(如A100、RTX 3090)上的MARL训练工作负载进行性能分析与瓶颈特征刻画。
  • 采用集中式评论家,使用联合观测-动作空间,同时保持去中心化执行者用于动作选择。
  • 在捕食者-猎物环境中,对3至48个智能体的场景进行验证,测量性能与学习稳定性。

实验结果

研究问题

  • RQ1在计算和内存访问方面,哪些MARL训练阶段是主要性能瓶颈?
  • RQ2小批量采样中的数据访问模式如何影响MARL中的缓存效率和训练性能?
  • RQ3局部感知邻居采样是否能在不降低学习质量的前提下减少MARL的训练时间?
  • RQ4随着MARL系统中智能体数量的增加,性能提升的可扩展性如何?
  • RQ5邻居采样对MARL的端到端训练时间和模型收敛性有何影响?

主要发现

  • 随着智能体数量从3个增加到48个,'更新所有训练器'阶段占据总训练时间的35%至85%,成为主导阶段。
  • 小批量采样阶段因缓存局部性差而出现显著性能下降,尤其在观测-动作空间较大时更为明显。
  • 邻居采样提升了缓存局部性,使采样阶段运行时间减少26.66%(3个智能体)至27.39%(12个智能体)。
  • 在12个智能体的MARL工作负载中,采用该优化后,端到端训练时间减少10.2%。
  • 该优化保持了高水平的学习性能,在所有测试的智能体数量下,平均回合奖励均无显著下降。
  • 性能提升在MADDPG和MASAC两种框架中均一致,表明其在不同MARL算法间具有良好的通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。