[论文解读] Marathon Environments: Multi-Agent Continuous Control Benchmarks in a Modern Video Game Engine
本文介绍了Marathon Environments,这是一个基于Unity游戏引擎并使用ML-Agents工具包构建的开源多智能体连续控制基准测试套件。结果表明,通过优化训练策略,可在商业游戏引擎中有效训练先进的深度强化学习策略(如基于动作捕捉数据的行走、跑步和后空翻),并显著减少训练时间。
Recent advances in deep reinforcement learning in the paradigm of locomotion using continuous control have raised the interest of game makers for the potential of digital actors using active ragdoll. Currently, the available options to develop these ideas are either researchers' limited codebase or proprietary closed systems. We present Marathon Environments, a suite of open source, continuous control benchmarks implemented on the Unity game engine, using the Unity ML- Agents Toolkit. We demonstrate through these benchmarks that continuous control research is transferable to a commercial game engine. Furthermore, we exhibit the robustness of these environments by reproducing advanced continuous control research, such as learning to walk, run and backflip from motion capture data; learning to navigate complex terrains; and by implementing a video game input control system. We show further robustness by training with alternative algorithms found in OpenAI.Baselines. Finally, we share strategies for significantly reducing the training time.
研究动机与目标
- 通过创建可访问、开源的基准测试,弥合学术强化学习研究与真实世界游戏引擎部署之间的差距。
- 证明在仿真环境中训练的连续控制策略可稳健地迁移到Unity等商业游戏引擎中。
- 提供一个可扩展、可扩展的平台,用于在复杂、动态环境中使用动作捕捉数据训练多智能体系统。
- 通过优化超参数调优和环境设计,减少深度强化学习基准测试中的训练时间。
提出的方法
- 作者使用ML-Agents工具包在Unity游戏引擎中实现了支持多智能体训练的一系列连续控制环境。
- 环境设计支持使用动作捕捉数据作为示范,实现复杂的运动行为,如行走、跑步和后空翻。
- 集成了视频游戏输入控制系统,以实现类人控制并评估学习到的策略。
- 该框架支持多种强化学习算法的训练,从而实现跨算法验证和鲁棒性测试。
- 通过超参数优化和环境级工程改进(包括状态归一化和奖励塑造),提升了训练效率。
- 通过复现连续控制中的最先进结果(包括基于动作捕捉数据的复杂运动技能),对系统进行了验证。
实验结果
研究问题
- RQ1能否在Unity等商业游戏引擎中成功训练复杂运动的深度强化学习策略?
- RQ2在Marathon Environments中训练的连续控制策略性能与传统研究环境中的表现相比如何?
- RQ3在模拟的多智能体环境中,动作捕捉数据在多大程度上能有效指导策略学习?
- RQ4哪些训练优化措施能显著减少连续控制基准测试中的样本效率和时间效率?
- RQ5同一环境能否支持多种算法和多智能体协作任务?
主要发现
- Marathon Environments框架成功实现了使用动作捕捉数据训练复杂运动行为(如行走、跑步和后空翻)。
- 在多种强化学习算法上,训练出的策略均表现出稳定性能,证明了其鲁棒性和可迁移性。
- 通过集成视频游戏输入系统,实现了对学习行为的直接人工评估与验证。
- 通过环境级优化和超参数调优,显著减少了样本效率和实际运行时间。
- 该框架支持多智能体训练与协作,证实其在单智能体任务之外具备可扩展性。
- 该基准测试套件的开源性质使更广泛的科研社区能够实现结果复现和功能扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。