Skip to main content
QUICK REVIEW

[论文解读] CORA: Benchmarks, Baselines, and Metrics as a Platform for Continual Reinforcement Learning Agents

Sam Powers, Eliot Xing|arXiv (Cornell University)|Oct 19, 2021
Domain Adaptation and Few-Shot Learning参考文献 71被引用 9
一句话总结

CORA 是一个统一的持续强化学习平台,提供标准化基准、开源基线以及三种新型度量——持续评估、孤立遗忘和零样本正向迁移——覆盖包括 Atari、Procgen、MiniHack 和 CHORES 在内的多样化环境。该平台实现了对持续强化学习智能体的公平、可复现的评估,表明即使是最先进的方法如 CLEAR 在灾难性遗忘和迁移学习方面仍面临重大挑战。

ABSTRACT

Progress in continual reinforcement learning has been limited due to several barriers to entry: missing code, high compute requirements, and a lack of suitable benchmarks. In this work, we present CORA, a platform for Continual Reinforcement Learning Agents that provides benchmarks, baselines, and metrics in a single code package. The benchmarks we provide are designed to evaluate different aspects of the continual RL challenge, such as catastrophic forgetting, plasticity, ability to generalize, and sample-efficient learning. Three of the benchmarks utilize video game environments (Atari, Procgen, NetHack). The fourth benchmark, CHORES, consists of four different task sequences in a visually realistic home simulator, drawn from a diverse set of task and scene parameters. To compare continual RL methods on these benchmarks, we prepare three metrics in CORA: Continual Evaluation, Isolated Forgetting, and Zero-Shot Forward Transfer. Finally, CORA includes a set of performant, open-source baselines of existing algorithms for researchers to use and expand on. We release CORA and hope that the continual RL community can benefit from our contributions, to accelerate the development of new continual RL algorithms.

研究动机与目标

  • 为解决持续强化学习研究中高准入门槛的问题,包括代码缺失、计算资源需求高以及缺乏标准化基准。
  • 通过提供统一、开源的平台,实现持续强化学习的民主化,包含可复现的基线和评估协议。
  • 通过在多样化学习挑战(如灾难性遗忘、可塑性以及零样本迁移)之间系统比较持续强化学习方法,实现系统性评估。
  • 通过模块化、可扩展的代码和标准化度量,支持新持续强化学习算法的开发与评估。
  • 通过提供如 CHORES 这类真实、多样化的环境(一个视觉丰富的家庭模拟环境),加速迈向现实世界持续学习智能体的进展。

提出的方法

  • CORA 集成了四个独立的基准:Atari、Procgen、MiniHack 和 CHORES,每个基准均针对持续学习的特定方面(如泛化能力、可扩展性及现实适用性)进行设计。
  • 该平台引入了三项核心度量:持续评估(在任务序列中的整体性能)、孤立遗忘(对先前学习任务的遗忘程度)和零样本正向迁移(在未见任务变体上的表现)。
  • CORA 提供了成熟持续强化学习算法的开源实现,包括 CLEAR、EWC 和 P&C,使研究社区能够直接进行比较和扩展。
  • CHORES 基准模拟了一个具有可变任务、物体和房间布局的真实家庭环境,支持在复杂、动态环境中评估泛化能力和迁移能力。
  • 所有基准和度量均以模块化、可扩展的代码库形式实现,并托管于 GitHub,确保可复现性并便于集成到现有研究工作流中。
  • 实验在多个任务序列上进行,并采用统计报告(均值 ± 标准误),以实现对方法性能的稳健比较。

实验结果

研究问题

  • RQ1现有持续强化学习算法在测试不同方面持续学习能力的多样化基准上表现如何?
  • RQ2在顺序环境中学习新任务时,当前方法在多大程度上缓解了灾难性遗忘?
  • RQ3在如 CHORES 这类真实、视觉复杂的环境中,能否有效衡量并改进零样本正向迁移?
  • RQ4持续评估、孤立遗忘和零样本正向迁移等不同度量与现实世界持续学习性能的相关性如何?
  • RQ5在新的多样化基准(如 CHORES 和 MiniHack)上评估时,最先进方法(如 CLEAR)存在哪些局限性?

主要发现

  • 在 Atari 和 Procgen 上,CLEAR 在持续评估指标上优于其他基线方法,但在更复杂的环境中仍表现出显著遗忘和有限的迁移能力。
  • 在 CHORES 基准上,EWC 和 P&C 展现出较高的遗忘分数(例如,EWC 在 Mem-VaryObjects 上为 -3.2 ± 3.2),表明对先前学习任务的保留能力差。
  • CLEAR 在 Mem-VaryTasks(2.6 ± 2.9)和 Mem-VaryObjects(2.6 ± 2.9)上实现了最高的零样本正向迁移,表明其泛化能力优于 EWC 和 P&C。
  • CHORES 基准揭示,即使表现最佳的方法在未见房间布局中也难以实现有效迁移,EWC 在 Gen-MultiTraj 上甚至表现出负向迁移(例如,-4.9 ± 2.0)。
  • 孤立遗忘度量显示,EWC 和 P&C 遭受严重遗忘(分别为 -3.2 ± 3.2 和 -3.2 ± 3.2),而 CLEAR 在任务间保持了更稳定的性能。
  • 该平台的度量表明,在 Atari 等标准基准上表现优异,并不能推广到更复杂、更真实的环境(如 CHORES),凸显了建立更好评估标准的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。