Skip to main content
QUICK REVIEW

[论文解读] Behavior From the Void: Unsupervised Active Pre-Training

Hao Liu, Pieter Abbeel|arXiv (Cornell University)|Mar 8, 2021
Reinforcement Learning in Robotics参考文献 78被引用 12
一句话总结

本文提出 APT(无监督主动预训练),一种新颖的强化学习预训练方法,通过在对比表示空间中使用基于粒子的熵最大化,主动探索并学习多样化的行为,而无需外部奖励。该方法在 12 款 Atari 游戏上达到人类水平性能,并在 DMControl 上实现了更高的数据效率和渐近性能,即使在从零开始训练极难的任务上也表现更优。

ABSTRACT

We introduce a new unsupervised pre-training method for reinforcement learning called APT, which stands for Active Pre-Training. APT learns behaviors and representations by actively searching for novel states in reward-free environments. The key novel idea is to explore the environment by maximizing a non-parametric entropy computed in an abstract representation space, which avoids challenging density modeling and consequently allows our approach to scale much better in environments that have high-dimensional observations (e.g., image observations). We empirically evaluate APT by exposing task-specific reward after a long unsupervised pre-training phase. In Atari games, APT achieves human-level performance on 12 games and obtains highly competitive performance compared to canonical fully supervised RL algorithms. On DMControl suite, APT beats all baselines in terms of asymptotic performance and data efficiency and dramatically improves performance on tasks that are extremely difficult to train from scratch.

研究动机与目标

  • 为解决从零开始训练强化学习智能体时的数据效率低下问题,通过无需访问外部奖励的任务无关预训练来实现。
  • 克服现有视觉强化学习无监督预训练方法的局限性,例如由于像素级密度建模导致的探索不足,或预训练数据中的分布不匹配问题。
  • 开发一种可扩展的、基于表示的探索策略,主动发现高维观测空间中的新状态。
  • 通过可泛化的预训练表示提升下游强化学习性能。
  • 证明基于抽象空间中非参数熵的内在奖励,相比稀疏奖励或 ImageNet 预训练,能实现更有效的预训练。

提出的方法

  • APT 使用非参数粒子基熵估计器,在对比表示空间中计算内在奖励,避免在高维状态空间中进行难以处理的密度建模。
  • 该方法通过对比学习学习表示空间,促进超球面上的一致性,并使距离具有意义,以支持熵估计。
  • 探索通过在表示空间中最大化熵来驱动,鼓励智能体访问环境中不同的新状态。
  • 预训练阶段不依赖环境奖励,随后在下游任务上使用稀疏或密集的外部奖励进行微调。
  • 该方法与现有强化学习算法兼容,本文中将其应用于当前最先进的视觉强化学习算法 DrQ。
  • APT 的一种变体使用仅正向的内在信号(例如,“不要死亡”),但实验证明其在有效探索方面不如基于熵的内在奖励。

实验结果

研究问题

  • RQ1在学习到的表示空间中进行熵最大化,是否能比像素级密度建模或 ImageNet 预训练更有效地实现无监督预训练?
  • RQ2由表示空间熵引导的主动探索,是否能提升下游强化学习任务的数据效率和渐近性能?
  • RQ3在样本效率和难以训练任务的性能方面,APT 与监督强化学习基线相比如何?
  • RQ4基于粒子的熵的内在奖励是否对有效探索至关重要,还是更简单的信号即可满足?
  • RQ5APT 的预训练模型是否能在多样任务上泛化,包括稀疏奖励或复杂奖励的任务?

主要发现

  • APT 在 57 款 Atari 游戏中的 12 款上达到人类水平性能,显著优于先前的无监督强化学习方法和 DQN。
  • 在完整的 Atari 57 套件上,APT 的中位人类归一化得分比最佳先前无监督方法高出 3 倍。
  • 在 DMControl 套件中,APT 在渐近性能和数据效率方面均优于 DrQ 和无监督强化学习基线,解决了从零开始训练时无法解决的任务。
  • 与仅使用“不要死亡”内在信号的变体相比,APT 访问的唯一 RAM 状态数量几乎多出 27 倍,证明了基于熵的内在奖励对有效探索的必要性。
  • 从预训练的策略-评论家头进行微调,相比随机初始化能实现更快的学习速度,5 款游戏中有 4 款在 3 个随机种子下的平均性能更优。
  • 该方法仅使用总训练样本的一小部分,即可达到与完全监督强化学习算法相当的性能,凸显其卓越的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。