[论文解读] Revisiting Parameter Sharing in Multi-Agent Deep Reinforcement Learning
该论文表明,参数共享——此前在多智能体深度强化学习中被低估的技术——通过完全集中化消除非平稳性,显著加速了学习并提升了性能。作者首次将参数共享应用于八种现代深度强化学习算法,在仅需先前参数共享设置16%的环境交互次数下,实现了高达44倍的平均奖励提升,显著优于基准多智能体强化学习环境的现有最先进结果,同时通过观测和动作空间填充技术将该方法扩展至异构智能体场景。
Parameter sharing, where each agent independently learns a policy with fully shared parameters between all policies, is a popular baseline method for multi-agent deep reinforcement learning. Unfortunately, since all agents share the same policy network, they cannot learn different policies or tasks. This issue has been circumvented experimentally by adding an agent-specific indicator signal to observations, which we term "agent indication". Agent indication is limited, however, in that without modification it does not allow parameter sharing to be applied to environments where the action spaces and/or observation spaces are heterogeneous. This work formalizes the notion of agent indication and proves that it enables convergence to optimal policies for the first time. Next, we formally introduce methods to extend parameter sharing to learning in heterogeneous observation and action spaces, and prove that these methods allow for convergence to optimal policies. Finally, we experimentally confirm that the methods we introduce function empirically, and conduct a wide array of experiments studying the empirical efficacy of many different agent indication schemes for image based observation spaces.
研究动机与目标
- 探究提升学习集中化程度是否能缓解合作型多智能体强化学习中的非平稳性问题。
- 评估参数共享——即极端集中化——在现代深度强化学习算法于多智能体强化学习基准测试中的性能表现。
- 将参数共享扩展至具有不同观测和动作空间的异构智能体。
- 形式化证明智能体标识、观测填充和动作空间填充在支持多样化多智能体强化学习环境参数共享中的可行性。
提出的方法
- 采用MAILP模型形式化信息传递动态,并推导在不同集中化程度下学习收敛性的理论边界。
- 首次在文献中将参数共享应用于八种现代深度强化学习算法(如SAC、PPO、SAC-BC),将单智能体方法的训练机制引入多智能体设置。
- 使用智能体标识,使单一共享策略能根据智能体身份在观测中进行条件化处理,从而实现不同智能体的差异化行为。
- 通过将较小的观测扩展至最大观测尺寸,实现观测填充,以统一各智能体的输入维度并保持输入结构。
- 通过将较小的动作空间扩展至最大尺寸,并截断超出范围的动作,实现动作空间填充,以对齐异构动作空间。
- 为智能体标识、观测填充和动作空间填充方法提供了形式化证明,证实其在支持异构多智能体强化学习中实现参数共享的正确性与功能性。
实验结果
研究问题
- RQ1提升学习集中化程度,最终实现参数共享,是否能带来合作型多智能体强化学习中更快的收敛速度和更优的性能?
- RQ2参数共享能否成功应用于DQN和DDPG等早期方法之外的现代深度强化学习算法?
- RQ3如何将参数共享扩展至具有不同观测和动作空间大小的异构智能体环境中?
- RQ4对于智能体标识、观测填充和动作空间填充等方法,能够提供哪些理论保证,以支持其在异构多智能体强化学习中实现参数共享?
- RQ5当将参数共享应用于标准多智能体强化学习基准测试中的最先进深度强化学习算法时,可实现多大的性能提升?
主要发现
- 参数共享在Gupta等人(2017)提出的多智能体强化学习基准测试套件中实现了有记录以来的最佳性能,创下新的最先进水平。
- 与以往记录的参数共享配置相比,该方法实现了最高达44倍的平均累积奖励提升。
- 性能仅在先前参数共享方法所需环境交互次数的16%以内即达成,表明样本效率获得显著提升。
- 在现代深度强化学习算法中,近端策略优化(PPO)和软演员-critic(SAC)在结合参数共享后表现出尤为出色的性能。
- 理论分析证实,通过完全集中化策略学习,参数共享可消除由非平稳性引起的收敛延迟。
- 所提出的三种方法——智能体标识、观测填充和动作空间填充——在异构多智能体强化学习设置中,被形式化证明可保持正确性与功能性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。