Skip to main content
QUICK REVIEW

[论文解读] A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions

Jiajun Fan|arXiv (Cornell University)|Dec 8, 2021
Reinforcement Learning in Robotics被引用 4
一句话总结

本文批判了当前Atari强化学习基准中评估指标的不足,指出人类基线分数低估了人类的巅峰表现。为此,本文提出了一种基于人类世界纪录(HWR)的新基准,用于评估最终性能与学习效率,结果表明,即使是最先进的智能体在57款游戏中仍未能达到超人类水平。

ABSTRACT

The Arcade Learning Environment (ALE) is proposed as an evaluation platform for empirically assessing the generality of agents across dozens of Atari 2600 games. ALE offers various challenging problems and has drawn significant attention from the deep reinforcement learning (RL) community. From Deep Q-Networks (DQN) to Agent57, RL agents seem to achieve superhuman performance in ALE. However, is this the case? In this paper, to explore this problem, we first review the current evaluation metrics in the Atari benchmarks and then reveal that the current evaluation criteria of achieving superhuman performance are inappropriate, which underestimated the human performance relative to what is possible. To handle those problems and promote the development of RL research, we propose a novel Atari benchmark based on human world records (HWR), which puts forward higher requirements for RL agents on both final performance and learning efficiency. Furthermore, we summarize the state-of-the-art (SOTA) methods in Atari benchmarks and provide benchmark results over new evaluation metrics based on human world records. We concluded that at least four open challenges hinder RL agents from achieving superhuman performance from those new benchmark results. Finally, we also discuss some promising ways to handle those problems.

研究动机与目标

  • 批判将人类基线分数作为Atari RL基准中人类表现代理指标的使用方式。
  • 论证当前评估指标因低估人类世界纪录而错误地呈现了超人类表现。
  • 提出一种基于人类世界纪录(HWR)的新基准,以对最终表现与学习效率设定更高标准。
  • 在新的HWR基准下评估最先进强化学习算法,并识别持续存在的挑战。
  • 提供一个全面的框架,用于评估Atari环境中实现超人类能力的能力。

提出的方法

  • 本文回顾了Atari基准中现有的评估指标,特别关注人类归一化分数(HNS)及其局限性。
  • 提出一种基于人类世界纪录(HWR)作为性能标准的新型基准,取代代表性不足的人类基线。
  • 作者扩展了SABER评估系统,引入基于HWR的新指标,包括HWRB(HWR基准)和学习效率得分。
  • 学习效率通过逆样本复杂度进行量化,衡量智能体相对于HWR达到高性能的速度。
  • 该方法在新的HWR基准指标下,对多种SOTA算法——包括无模型、基于模型及其他类型——在57款Atari游戏中进行了评估。
  • 提出一种多维评估框架,结合最终表现(HWRB)、中位表现(MED SABER)和学习效率(样本效率),以全面评估智能体能力。

实验结果

研究问题

  • RQ1当使用人类基线分数时,当前Atari RL中关于超人类表现的基准是否准确?
  • RQ2最先进强化学习智能体在最终表现与学习效率方面,能在多大程度上超越人类世界纪录?
  • RQ3为何当前SOTA智能体尽管优于人类基线,却仍无法实现超人类表现?
  • RQ4如何有意义地衡量学习效率,并将其整合进强化学习基准测试?
  • RQ5阻碍强化学习智能体在Atari环境中实现真正超人类表现的关键挑战是什么?

主要发现

  • 大多数先前基准中使用的人类基线显著低估了人类的巅峰表现,导致对超人类表现的误判。
  • 即使是最先进的智能体,如Agent57和基于DQN的模型,在多数Atari 57款游戏中仍未能超越人类世界纪录。
  • 所提出的基于HWR的基准(HWRB)显示,仅有22款游戏被表现最佳的智能体达成,表明存在巨大的性能差距。
  • 学习效率仍是主要瓶颈:最佳智能体达到可比性能水平所需的样本量,比人类高出数个数量级。
  • 在HWR基准下的中位表现(MED SABER)显示,智能体相对于人类世界纪录始终表现不佳,不同算法类别中位得分分别为24.86%和50.5%。
  • 本研究识别出四项阻碍超人类表现的开放性挑战:样本效率、跨游戏泛化能力、稀疏奖励下的鲁棒性,以及高维状态空间中的探索能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。