Skip to main content
QUICK REVIEW

[论文解读] Let's Play Again: Variability of Deep Reinforcement Learning Agents in Atari Environments

Kaleigh Clary, Emma Tosch|arXiv (Cornell University)|Apr 12, 2019
Reinforcement Learning in Robotics参考文献 5被引用 16
一句话总结

本文表明,在Atari环境中,即使使用相同的超参数和随机种子进行训练,深度强化学习智能体的性能仍表现出显著的可变性,这挑战了使用均值或最大奖励等单点估计值进行模型评估的常规做法。作者主张将智能体性能报告为多个测试回合得分的分布,认为这能更好地捕捉真实模型行为,并减少模型选择中的偏差。

ABSTRACT

Reproducibility in reinforcement learning is challenging: uncontrolled stochasticity from many sources, such as the learning algorithm, the learned policy, and the environment itself have led researchers to report the performance of learned agents using aggregate metrics of performance over multiple random seeds for a single environment. Unfortunately, there are still pernicious sources of variability in reinforcement learning agents that make reporting common summary statistics an unsound metric for performance. Our experiments demonstrate the variability of common agents used in the popular OpenAI Baselines repository. We make the case for reporting post-training agent performance as a distribution, rather than a point estimate.

研究动机与目标

  • 调查在Atari环境中,使用相同超参数和随机种子训练的深度强化学习智能体在性能可变性方面的程度。
  • 挑战使用单点指标(如均值或最大奖励)总结智能体性能的常见做法。
  • 证明智能体性能的可变性不仅源于随机种子的差异,也源于训练后模型本身的固有特性。
  • 主张将评估实践从报告点估计值转向报告性能分布,以提升模型选择的可复现性和公平性。
  • 为在性能分布呈多峰、重尾或高度可变时选择模型,提供统计指导。

提出的方法

  • 针对每个训练好的智能体,从多个测试回合(例如100个回合)中收集性能得分,使用相同训练好的策略在不同随机种子下进行测试。
  • 分析每个种子模型的得分分布,以评估模型内部的可变性,包括多峰性、重尾和偏态。
  • 通过可视化手段(如直方图)比较不同随机种子和算法(如A2C、PPO2、DQN)在Atari游戏(如Q*bert、Breakout、Space Invaders)中的性能分布。
  • 评估常见模型选择实践(如选择均值或最大得分最高的模型)因固有性能可变性而引入的选择偏差。
  • 提出统计校正方法,如重采样、Bonferroni校正以及基于得分分区的交叉验证,以应对多比较问题下的模型选择。
  • 报告性能时使用完整的得分分布而非总结统计量,尤其在分布非正态或呈多峰时。

实验结果

研究问题

  • RQ1在Atari环境中,使用相同超参数和随机种子的深度强化学习智能体在多个测试回合中,其性能可变性在多大程度上存在?
  • RQ2当性能分布呈多峰或重尾时,基于均值或最大得分的常见模型选择实践如何引入偏差?
  • RQ3当底层性能分布表现不佳时,报告点估计值(如均值 ± 标准误)会产生什么影响?
  • RQ4模型内部性能可变性如何影响深度强化学习中模型评估的可复现性和公平性?
  • RQ5在从多个种子智能体中选择模型时,可采用哪些统计方法来校正可变性?

主要发现

  • 在Atari环境中,即使使用相同随机种子训练,种子化的深度强化学习智能体在性能上仍表现出显著可变性,且不同测试回合间的得分分布差异巨大。
  • A2C在Q*bert上的性能分布呈双峰,均值为2425.4 ± 53.8,但由于中心区域密度较低,该均值不具备代表性,表明均值是具有误导性的总结指标。
  • PPO2在Breakout上的性能分布呈重尾,均值209.3 ± 3.2不可靠,因为极端得分显著影响了平均值。
  • 将所有种子模型的Space Invaders性能聚合后呈双峰分布,表明模型行为在不同种子间不一致,且模型内部可变性可能掩盖或扭曲整体趋势。
  • 基于最大得分选择模型会偏向高方差模型,而非预期性能更高的模型,从而在模型选择中引入显著偏差。
  • 将性能报告为多个测试回合得分的分布,比依赖点估计值更具信息量和可靠性,尤其在分布非正态或多峰时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。