[论文解读] PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
本文提出PTDE,一种新颖的两阶段多智能体强化学习范式,通过专用的全局信息模块在训练过程中为每个智能体个性化全局信息,随后将这种智能体特定的知识蒸馏到仅依赖本地观测的策略中,实现去中心化执行。PTDE在SMAC和Google Research Football基准测试中显著提升了多智能体协作性能,且无性能下降。
Centralized Training with Decentralized Execution (CTDE) has emerged as a widely adopted paradigm in multi-agent reinforcement learning, emphasizing the utilization of global information for learning an enhanced joint $Q$-function or centralized critic. In contrast, our investigation delves into harnessing global information to directly enhance individual $Q$-functions or individual actors. Notably, we discover that applying identical global information universally across all agents proves insufficient for optimal performance. Consequently, we advocate for the customization of global information tailored to each agent, creating agent-personalized global information to bolster overall performance. Furthermore, we introduce a novel paradigm named Personalized Training with Distilled Execution (PTDE), wherein agent-personalized global information is distilled into the agent's local information. This distilled information is then utilized during decentralized execution, resulting in minimal performance degradation. PTDE can be seamlessly integrated with state-of-the-art algorithms, leading to notable performance enhancements across diverse benchmarks, including the SMAC benchmark, Google Research Football (GRF) benchmark, and Learning to Rank (LTR) task.
研究动机与目标
- 解决多智能体强化学习中集中训练、去中心化执行(CTDE)范式下的局限性,即统一的全局信息无法捕捉智能体特定需求。
- 通过引入针对个体智能体定制的全局信息,克服简单共享全局信息导致的性能下降问题。
- 通过知识蒸馏将智能体特定的全局知识提炼到仅使用本地观测的策略中,实现在不牺牲性能的前提下实现去中心化执行。
- 在包括值分解和演员-评论家方法在内的多种MARL算法与环境中,验证所提范式的普适性。
- 提供一个可泛化的框架,在复杂、部分可观测的多智能体环境中增强协作能力,且推理阶段无需全局信息。
提出的方法
- 引入两阶段训练流程:首先,通过全局信息专业化(GIS)模块,使用智能体特定的全局信息训练教师网络。
- 设计GIS模块,采用智能体-超网络动态生成权重,用于智能体专业化网络,将原始全局状态转换为智能体特定的全局表征。
- 使用知识蒸馏,将教师网络(使用全局+本地输入)中的智能体特定全局知识,迁移至仅使用本地输入的学生网络。
- 在推理阶段,用学生网络替代教师网络,实现仅依赖本地观测的完全去中心化执行。
- 通过最小化教师与学生网络之间Q值或动作概率的差异,确保学生网络能够有效模仿教师的行为。
- 将PTDE框架应用于值分解(如VDN)和演员-评论家(如MAPPO)算法,证明其广泛的兼容性。
实验结果
研究问题
- RQ1在训练过程中使用统一的全局信息是否会导致多智能体协作性能劣于使用智能体特定的全局信息?
- RQ2智能体特定的全局信息是否能在复杂环境中显著提升多智能体强化学习算法的性能?
- RQ3当将智能体特定的全局知识蒸馏到仅依赖本地观测的策略中以实现去中心化执行时,知识蒸馏在多大程度上保持了性能?
- RQ4PTDE范式是否普遍适用于不同MARL算法,如值分解和演员-评论家方法?
- RQ5PTDE框架是否在StarCraft II和Google Research Football等多样化环境中均保持强大性能?
主要发现
- 使用智能体特定全局信息(SGI)始终优于统一全局信息(UGI),QMIX_SGI在GRF的academy_3_vs_2_with_keeper环境中达到110.2%的性能比。
- QMIX_SGI在所有GRF场景中均取得最高胜率,证实智能体特定全局信息比统一全局信息更能有效增强协作能力。
- 知识蒸馏性能保持极为出色,academy_3_vs_1_with_keeper和academy_run_pass_and_shoot_with_keeper中的PRR(性能比)值在95%至100%之间,表明蒸馏后性能损失极小。
- 在SMAC中,VDN_SGI在困难和超难场景下均优于VDN_UGI,MAPPO_SGI也优于MAPPO_UGI,证明PTDE在不同算法家族中的有效性。
- PTDE范式具有普适性:它同时增强值分解(VDN)和演员-评论家(MAPPO)算法,并在SMAC和GRF等多样化环境中表现优异。
- 由于观测-状态重复性高且稀疏奖励结构明显,学生网络能有效从本地观测中恢复智能体特定的全局信息,从而实现鲁棒的蒸馏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。