[论文解读] Bigger, Better, Faster: Human-level Atari with human-level efficiency
该论文提出BBF,一种基于值函数的强化学习智能体,在仅使用2小时游戏时间的情况下,通过扩大神经网络宽度并采用高效的训练技术(如周期性重置和高回放缓冲比例),在Atari 100K基准上实现了超人类性能——其在200万次环境交互步内达到DQN的性能水平,显著提升了样本效率。BBF在无模型强化学习中树立了新的样本效率标准,相比以往方法,样本效率最高提升16倍,同时相比基于模型的基线方法,运行时间减少4倍。
We introduce a value-based RL agent, which we call BBF, that achieves super-human performance in the Atari 100K benchmark. BBF relies on scaling the neural networks used for value estimation, as well as a number of other design choices that enable this scaling in a sample-efficient manner. We conduct extensive analyses of these design choices and provide insights for future work. We end with a discussion about updating the goalposts for sample-efficient RL research on the ALE. We make our code and data publicly available at https://github.com/google-research/google-research/tree/master/bigger_better_faster.
研究动机与目标
- 开发一种无模型深度强化学习智能体,在Atari 100K基准上实现人类水平性能,且样本效率与人类学习相当。
- 研究在基于值函数的强化学习中,扩大神经网络宽度和回放缓冲比例对样本效率和性能的影响。
- 识别在样本受限环境中稳定高效训练大规模网络的关键架构与训练组件。
- 通过展示以极低环境交互次数实现超人类性能,提出新的样本高效强化学习基准目标。
提出的方法
- BBF采用宽度增加的残差网络(ResNet)架构,提升价值函数的表达能力,通过基于双DQN的算法与优先经验回放进行训练。
- 智能体使用高回放缓冲比例(最高达8)和周期性网络重置,以缓解灾难性遗忘,同时在长时间训练阶段保持可塑性。
- 在观测数据上引入自监督对比学习,以提升特征表示学习能力,且无需额外奖励信号。
- 训练流程包括粘滞动作(sticky actions)和课程式训练,逐步提高回放缓冲比例,以在早期阶段稳定学习。
- 性能通过26个Atari 100K游戏的人类归一化得分的四分位均值(IQM)进行评估,并对关键组件进行消融研究。
- 该方法计算效率高,仅需约1小时的A100 GPU时间即可完成4万次环境交互步(回放缓冲比为2)。
实验结果
研究问题
- RQ1在基于值函数的强化学习智能体中,通过扩大神经网络宽度和回放缓冲比例,是否能够实现在Atari 100K上以人类水平的样本效率达到超人类性能?
- RQ2周期性网络重置和自监督表示学习在大规模、样本受限的强化学习中,对训练稳定性和性能的贡献如何?
- RQ3高回放缓冲比例和架构扩展在多大程度上提升了泛化能力并防止深度强化学习智能体的性能停滞?
- RQ4无模型强化学习智能体是否能在样本效率和计算成本两方面均超越最先进的基于模型方法(如EfficientZero)?
- RQ5在结合大网络和高回放缓冲比例的情况下,从像素中进行的自监督学习是否能提升样本稀缺强化学习的性能?
主要发现
- BBF在26个Atari 100K游戏中实现了四分位均值(IQM)人类归一化得分超过1.0,证明其仅用2小时游戏时间即达到超人类性能。
- 与DQN、Rainbow和IQN相比,BBF的样本效率至少提升了16倍;与近期强基线SR-SPR相比,样本效率提升5倍。
- 在200万次环境交互步时,BBF达到DQN在256小时训练后才达到的最终性能,表明其在样本受限条件下具备极快的学习速度。
- BBF在2000万次环境交互步内达到Rainbow的最终性能,仅用100万次交互步即实现相近结果,且无需调整超参数。
- 即使仅使用5万次环境交互步且启用粘滞动作,BBF仍优于近期算法在10万次交互步内训练且未启用粘滞动作的性能。
- BBF相比EfficientZero将运行时间至少减少4倍,同时达到相似性能,证明其在计算效率方面具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。