[论文解读] APS: Active Pretraining with Successor Features
APS提出了一种用于强化学习的新型无监督预训练方法,通过变分后继特征联合最大化状态熵并最小化条件熵,实现了高效的探索和快速的任务适应。在Atari 100k上的评估显示,APS达到了最先进性能,优于以往方法,在数据效率和渐近性能方面均有提升。
We introduce a new unsupervised pretraining objective for reinforcement learning. During the unsupervised reward-free pretraining phase, the agent maximizes mutual information between tasks and states induced by the policy. Our key contribution is a novel lower bound of this intractable quantity. We show that by reinterpreting and combining variational successor features~\citep{Hansen2020Fast} with nonparametric entropy maximization~\citep{liu2021behavior}, the intractable mutual information can be efficiently optimized. The proposed method Active Pretraining with Successor Feature (APS) explores the environment via nonparametric entropy maximization, and the explored data can be efficiently leveraged to learn behavior by variational successor features. APS addresses the limitations of existing mutual information maximization based and entropy maximization based unsupervised RL, and combines the best of both worlds. When evaluated on the Atari 100k data-efficiency benchmark, our approach significantly outperforms previous methods combining unsupervised pretraining with task-specific finetuning.
研究动机与目标
- 为解决现有无监督预训练方法在强化学习中的局限性,特别是基于互信息的方法探索能力差,以及基于熵的方法缺乏任务条件性。
- 开发一种统一的预训练目标,同时利用状态熵最大化与任务条件行为学习,以提升下游任务的性能。
- 实现高效、无奖励的预训练,支持在极低环境交互下对下游任务进行快速微调。
- 证明将非参数熵最大化与变分后继特征结合,可在Atari基准上实现更优的数据效率与性能。
提出的方法
- APS将预训练目标定义为互信息 I(s;z) = H(s) - H(s|z),其中 s 为状态,z 为任务变量,以同时促进探索与任务特定行为的学习。
- 采用非参数熵最大化(类似APT的方法)在低维抽象表征空间中最大化 H(s),以促进探索。
- 通过后继特征引入对不可计算条件熵 H(s|z) 的变分下界,实现高效优化。
- 利用共享表征学习(通过共享编码器)提升数据效率与表征质量。
- APS在无奖励阶段训练智能体,通过熵最大化收集经验,随后在稀疏奖励的下游任务上进行微调。
- 该框架结合基于粒子的熵估计与后继特征建模,实现探索与任务特定技能发现之间的平衡。
实验结果
研究问题
- RQ1将状态熵最大化与任务条件行为学习相结合,是否能提升强化学习中的数据效率?
- RQ2使用 H(s|z) 条件熵的变分下界,是否能在无需密度估计的情况下实现有效预训练?
- RQ3在探索与下游任务适应方面,APS 与 APT 和 VISR 相比表现如何?
- RQ4共享表征学习在预训练阶段在多大程度上提升了性能?
主要发现
- 在完整基准的57款Atari游戏中,APS在15款游戏中达到超人类性能,超越所有先前方法(此前最高仅12款超人类游戏)。
- 在26款游戏的Atari 100k子集上,APS的标准化人类得分达到99.04(均值)与58.80(中位数),显著优于先前最先进方法。
- 消融实验表明,当用作数据收集方法时,APS在性能上优于 APT 和 VISR 变体,表明探索与任务条件性结合带来了协同增益。
- 即使不进行微调,APS仍展现出强大的零样本性能(均分81.41),优于经过微调的 VISR,证明了预训练本身的价值。
- 使用共享编码器可提升数据效率,因为无共享编码器的 APS 均分仅为87.59,低于完整方法的99.04。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。