[论文解读] XuanCe: A Comprehensive and Unified Deep Reinforcement Learning Library
XuanCe 是一个统一的、开源的深度强化学习库,支持 PyTorch、TensorFlow 和 MindSpore,包含 40 多种单智能体和多智能体 DRL 算法。它实现了跨框架兼容性、模块化可扩展性,并在 MuJoCo、Atari 和 StarCraft II 环境中实现了高性能,使用一致的超参数设置在基准任务上取得了最先进结果。
In this paper, we present XuanCe, a comprehensive and unified deep reinforcement learning (DRL) library designed to be compatible with PyTorch, TensorFlow, and MindSpore. XuanCe offers a wide range of functionalities, including over 40 classical DRL and multi-agent DRL algorithms, with the flexibility to easily incorporate new algorithms and environments. It is a versatile DRL library that supports CPU, GPU, and Ascend, and can be executed on various operating systems such as Ubuntu, Windows, MacOS, and EulerOS. Extensive benchmarks conducted on popular environments including MuJoCo, Atari, and StarCraftII multi-agent challenge demonstrate the library's impressive performance. XuanCe is open-source and can be accessed at https://github.com/agi-brain/xuance.git.
研究动机与目标
- 为解决缺乏一个统一、可扩展的 DRL 库,该库支持多种深度学习框架(PyTorch、TensorFlow、MindSpore)和多样化的强化学习算法的问题。
- 通过提供模块化组件和统一的 API,提升算法的可重用性和可扩展性,适用于不同的 DRL 和 MARL 算法。
- 在多种硬件(CPU、GPU、Ascend)和操作系统(Ubuntu、Windows、macOS、EulerOS)上实现高效训练,保持一致的性能表现。
- 支持在线策略和离线策略算法,包括复杂的多智能体场景,并在标准基准上实现标准化评估。
- 为用户提供全面的文档和可扩展性支持,便于轻松添加新算法和环境。
提出的方法
- 该库使用基于 YAML 的配置文件管理超参数、环境设置和模型架构,实现灵活且可复现的配置。
- 采用模块化设计,将环境、算法、通用工具和配置等组件解耦,提升代码的可重用性和可扩展性。
- 通过统一的 API 抽象底层深度学习框架,利用公共接口层实现与 PyTorch、TensorFlow 和 MindSpore 的无缝集成。
- 通过向量化环境实现并行环境交互,提升样本效率和训练速度,尤其适用于在线策略算法。
- 在多智能体任务中,采用基于 RNN 的表示(GRU)处理部分可观测性,并通过参数共享降低模型复杂度。
- 基准测试采用标准化的训练协议和评估指标(如胜率、累积奖励),并在多个随机种子下进行,以确保结果可靠性。
实验结果
研究问题
- RQ1一个单一的 DRL 库能否有效统一多种深度学习框架(PyTorch、TensorFlow、MindSpore),同时保持高性能和可扩展性?
- RQ2模块化、基于配置的架构在多智能体 DRL 算法的快速原型设计和新算法集成方面表现如何?
- RQ3XuanCe 在 MuJoCo、Atari 和 SMAC 等标准基准上,能否实现与已发表 SOTA 结果相当的性能?
- RQ4该库在部分可观测的多样化协作与竞争场景中,对多智能体训练的支持效果如何?
- RQ5该库的统一 API 和模块化组件能否显著降低新算法和新环境的开发与集成开销?
主要发现
- 在 Atari 环境中,XuanCe 实现了 4820.0 ± 2429.32 的平均人类归一化得分,优于在相同超参数和网络结构下发表的 DQN 和 PPO 结果。
- 在 MuJoCo 基准测试中,XuanCe 实现了 5008.7 ± 1235 的平均得分,展现了在多种连续控制任务中的强劲性能。
- 在 StarCraft II 多智能体挑战(SMAC)中,所有测试的 MARL 算法(包括 IQL、VDN、QMIX、WQMIX、VDAC-mix、IPPO 和 MAPPO)在九个复杂度各异的地图上均表现出稳定且有效的学习曲线。
- 在 2m_vs_1z 地图上,使用 QMIX 和 WQMIX 的库实现了超过 90% 的胜率,表明在协作式多智能体设置中具备出色的样本效率和泛化能力。
- 基准测试结果表明,当使用相同的网络架构和超参数时,XuanCe 与已发表的 SOTA 结果保持了高度一致的性能表现。
- 该库的模块化设计和统一 API 成功实现了新算法和新环境的无缝集成,如在支持 40 多种算法和多个基准环境方面的成功扩展所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。