[论文解读] Scaling Multi-Agent Reinforcement Learning with Selective Parameter Sharing
本文提出选择性参数共享(SePS),一种在训练前根据智能体的习得行为和目标动态划分其为聚类的方法,仅在相似智能体之间实现高效且有效的参数共享。SePS 在复杂环境中实现了更高的最终回报,同时提升了样本效率和训练速度,相较于朴素参数共享或独立网络,能成功扩展至数百个异构智能体。
Sharing parameters in multi-agent deep reinforcement learning has played an essential role in allowing algorithms to scale to a large number of agents. Parameter sharing between agents significantly decreases the number of trainable parameters, shortening training times to tractable levels, and has been linked to more efficient learning. However, having all agents share the same parameters can also have a detrimental effect on learning. We demonstrate the impact of parameter sharing methods on training speed and converged returns, establishing that when applied indiscriminately, their effectiveness is highly dependent on the environment. We propose a novel method to automatically identify agents which may benefit from sharing parameters by partitioning them based on their abilities and goals. Our approach combines the increased sample efficiency of parameter sharing with the representational capacity of multiple independent networks to reduce training time and increase final returns.
研究动机与目标
- 为解决多智能体强化学习中朴素参数共享的局限性,即在异构环境中 indiscriminate(无差别)共享会损害学习效果。
- 通过识别可从共享表征中受益的智能体组,提升训练效率和最终性能。
- 通过结合参数共享的优势与独立网络的表征能力,实现多智能体强化学习向数百个智能体的扩展。
- 通过防止共享参数中冲突的策略更新,减少训练过程中智能体之间的干扰。
- 提供一种预训练方法用于架构配置,以增强学习效果,且无需在训练过程中进行动态重构。
提出的方法
- 在策略训练开始前,利用收集的轨迹将智能体编码到嵌入空间中。
- 对嵌入应用无监督聚类算法,将行为和目标相似的智能体分组。
- 仅在每个聚类内部应用参数共享,为不同智能体组创建独立的神经网络头。
- 该方法作为预训练步骤,于策略优化开始前建立固定架构。
- SePS 兼容采用经验共享的集中式训练(CTDE)框架,如 MADDPG、Q-Mix 和 SEAC。
- 该方法避免了每个智能体独立网络带来的计算开销,同时保持了对多样化角色的表征能力。
实验结果
研究问题
- RQ1在异构多智能体环境中,朴素参数共享是否会降低学习性能?
- RQ2基于行为相似性的智能体聚类能否提升多智能体强化学习中参数共享的有效性?
- RQ3与完全共享或无共享相比,选择性参数共享在多大程度上提升了训练速度和最终回报?
- RQ4当智能体具有不同角色和动力学特性时,SePS 是否能扩展至数百个智能体?
- RQ5与 SEAC 等经验共享基线方法相比,SePS 在计算效率和性能方面表现如何?
主要发现
- 在多个环境中,SePS 的最终回报均高于朴素参数共享和独立网络。
- 与独立网络相比,SePS 显著缩短了训练时间,同时保持或提升了样本效率。
- 在非同质智能体环境中,SePS 在收敛速度和最终性能方面均优于完全参数共享(FuPS)和无参数共享(NoPS)。
- SePS 在非同质环境中成功扩展至最多 200 个智能体,展现出对大规模多智能体设置的鲁棒性。
- 该方法有效识别出基于行为相似性的智能体分组,实现了有针对性的参数共享,且未在不相似角色之间造成干扰。
- 使用 SePS 的强化学习在训练过程中显著减少了智能体间的干扰,因为智能体不再更新冲突的共享参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。