Skip to main content
QUICK REVIEW

[论文解读] URLB: Unsupervised Reinforcement Learning Benchmark

Michael Laskin, Denis Yarats|arXiv (Cornell University)|Oct 28, 2021
Reinforcement Learning in Robotics被引用 11
一句话总结

URLB 引入了一个统一的无监督强化学习(URL)基准,对 DeepMind Control Suite 中的 12 个连续控制任务实现了预训练和微调的标准化。它使用统一的优化主干对八种领先的无监督 RL 算法进行评估,发现目前没有任何方法能完全解决该基准,凸显了在自监督 RL 中改进探索和泛化能力的迫切需求。

ABSTRACT

Deep Reinforcement Learning (RL) has emerged as a powerful paradigm to solve a range of complex yet specific control tasks. Yet training generalist agents that can quickly adapt to new tasks remains an outstanding challenge. Recent advances in unsupervised RL have shown that pre-training RL agents with self-supervised intrinsic rewards can result in efficient adaptation. However, these algorithms have been hard to compare and develop due to the lack of a unified benchmark. To this end, we introduce the Unsupervised Reinforcement Learning Benchmark (URLB). URLB consists of two phases: reward-free pre-training and downstream task adaptation with extrinsic rewards. Building on the DeepMind Control Suite, we provide twelve continuous control tasks from three domains for evaluation and open-source code for eight leading unsupervised RL methods. We find that the implemented baselines make progress but are not able to solve URLB and propose directions for future research.

研究动机与目标

  • 解决无监督强化学习(URL)算法缺乏统一基准的问题。
  • 通过标准化预训练和微调流程,实现无监督 RL 方法的公平且透明的比较。
  • 促进通用型 RL 智能体的发展,使其在无监督预训练后能高效适应新任务。
  • 为基准环境和八种领先的无监督 RL 基线提供开源代码,并采用统一的优化主干。
  • 识别当前 URL 方法的关键局限性,并为未来研究提出有前景的方向。

提出的方法

  • 设计一个两阶段基准:(i) 使用内在奖励进行无奖励预训练,(ii) 使用外在奖励进行下游微调。
  • 基于 DeepMind Control Suite,涵盖 Walker、Quadruped 和 Jaco 三个领域,共 12 个连续控制任务,难度各不相同。
  • 使用单一、统一的优化主干实现八种领先的无监督 RL 算法(如 RND、ProtoRL、DIAYN、SMM、APS),以确保公平比较。
  • 使用基于像素和基于状态的观测,评估不同输入模态下的泛化能力。
  • 对所有算法和任务统一预训练时长(100k 至 2M 帧)和微调协议。
  • 采用固定评估协议,每项实验使用 10 个随机种子,以确保可复现性和统计稳健性。

实验结果

研究问题

  • RQ1现有无监督 RL 算法是否能在标准化基准上实现强大的泛化能力和高效的少样本适应?
  • RQ2不同内在奖励机制(如预测误差、熵最大化、技能发现)在预训练质量方面如何比较?
  • RQ3在长时程、固定长度环境中,技能空间大小对基于能力的探索方法性能的限制程度如何?
  • RQ4观测模态的选择(像素 vs. 状态)是否显著影响无监督 RL 预训练的性能?
  • RQ5当前无监督 RL 方法中存在哪些关键瓶颈,导致其无法解决复杂多样的控制任务?

主要发现

  • 目前没有任何一种无监督 RL 算法能解决 URLB 基准中的全部 12 项任务,表明在预训练效率和探索能力方面仍有巨大提升空间。
  • 基于知识的方法(如 RND)和基于数据的方法(如 ProtoRL)在微调性能上表现相当,表明两种方法在驱动多样性探索方面均有效。
  • 基于能力的方法(如 DIAYN、SMM、APS)表现显著较差,可能是因为技能空间过小,导致在低级行为(如跌倒或趴在地上)上过拟合。
  • 表现最佳的方法在 100 万帧预训练后,Walker 和 Quadruped 领域的平均微调得分约为 300–500,但在最复杂的任务上仍无法达到最优性能。
  • 在 Jaco 操控任务中,即使是最优方法也仅取得有限成功,抓取任务的平均得分低于 50,表明其在灵巧操控任务上的泛化能力较差。
  • 该基准揭示,当前无监督 RL 方法在长时程、固定长度环境中表现不佳,尤其在预训练阶段缺乏外在奖励信号时,且当技能空间较小时问题更为严重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。