[论文解读] Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning
Sample Factory 引入了一种高吞吐量的单机强化学习系统,通过异步、GPU 加速采样和离策略校正,实现了每秒超过 100,000 个环境帧的性能。该系统可在 3D 环境中高效训练出高度熟练的智能体——通过自对弈和基于种群的训练,在多人 Doom 环境中训练出稳健策略——且无需依赖分布式集群。
Increasing the scale of reinforcement learning experiments has allowed researchers to achieve unprecedented results in both training sophisticated agents for video games, and in sim-to-real transfer for robotics. Typically such experiments rely on large distributed systems and require expensive hardware setups, limiting wider access to this exciting area of research. In this work we aim to solve this problem by optimizing the efficiency and resource utilization of reinforcement learning algorithms instead of relying on distributed computation. We present the "Sample Factory", a high-throughput training system optimized for a single-machine setting. Our architecture combines a highly efficient, asynchronous, GPU-based sampler with off-policy correction techniques, allowing us to achieve throughput higher than $10^5$ environment frames/second on non-trivial control problems in 3D without sacrificing sample efficiency. We extend Sample Factory to support self-play and population-based training and apply these techniques to train highly capable agents for a multiplayer first-person shooter game. The source code is available at https://github.com/alex-petrenko/sample-factory
研究动机与目标
- 通过优化单机吞吐量,减少对大规模分布式系统的依赖。
- 在通用硬件上实现复杂 3D 控制任务的高样本效率和高训练吞吐量。
- 通过单节点设置,实现可扩展的基于种群和自对弈的多智能体训练。
- 证明单机极端吞吐量可达到或超越大规模分布式系统的性能。
提出的方法
- 该系统使用异步、基于 GPU 的采样器,在多个环境实例上并行生成动作并收集环境转移数据。
- 采用离策略校正技术,在异步数据收集的情况下仍能保持样本效率。
- 系统架构围绕异步近端策略优化(APPO)构建,可使用经验的小批量进行高效梯度更新。
- 集中式学习器组件聚合来自多个智能体的梯度,并异步更新策略模型。
- 通过动态调整超参数并根据胜率重新初始化表现不佳的智能体,系统支持自对弈和基于种群的训练。
- 通过单张 GPU 上的批量推理最大化吞吐量,在 36 核、4 张 GPU 的服务器上最高达到 130,000 FPS。
实验结果
研究问题
- RQ1单机强化学习系统是否能在 3D 控制任务中实现超过 100,000 个环境帧每秒的吞吐量?
- RQ2当与高吞吐量异步采样结合时,离策略校正技术是否能维持样本效率?
- RQ3在无分布式基础设施的情况下,能否在单机上有效扩展自对弈和基于种群的训练?
- RQ4高吞吐量单机训练是否能产生比对抗脚本对手训练出的策略更具泛化能力的策略?
- RQ5此类系统能否训练出在复杂、策略性 3D 多人游戏(如 Doom)中达到高水平竞技能力的智能体?
主要发现
- Sample Factory 在单台 36 核、4 张 GPU 的服务器上实现了最高 130,000 个环境帧每秒的吞吐量,在所有评估的 3D 环境中均超过 100,000 FPS。
- 在对抗脚本控制机器人的训练中,智能体赢得了 100% 的比赛,但对对手类型过拟合,表现出缺乏鲁棒性。
- 在自对弈训练中,基于种群的方法产生了多样化策略,最终智能体在对抗脚本机器人训练出的智能体时,100 场比赛中赢下 78 场。
- 自对弈智能体在对抗脚本机器人训练出的智能体时,取得 78 场胜利、19 场平局和 3 场失败,表明其具备更优的泛化能力和鲁棒性。
- 该系统在单台服务器上实现了 8 个智能体在 1v1 Doom 环境中各训练 25 亿帧,相当于消耗了约 18 年的模拟经验。
- 尽管性能优异,但智能体仍未能达到专家人类玩家的水平,主要受限于缺乏音频感知和多模态感官整合能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。