[论文解读] Mastering the Unsupervised Reinforcement Learning Benchmark from Pixels
该论文提出了一种新颖的无监督强化学习方法,结合基于模型的预训练与任务感知微调,并采用混合规划器 Dyna-MPC,在基于像素的无监督强化学习基准(URLB)上实现了 93.59% 的归一化性能,达到当前最先进水平,显著优于先前方法,其优势源于自监督世界模型的构建以及在想象中实现的高效规划。
Controlling artificial agents from visual sensory data is an arduous task. Reinforcement learning (RL) algorithms can succeed but require large amounts of interactions between the agent and the environment. To alleviate the issue, unsupervised RL proposes to employ self-supervised interaction and learning, for adapting faster to future tasks. Yet, as shown in the Unsupervised RL Benchmark (URLB; Laskin et al. 2021), whether current unsupervised strategies can improve generalization capabilities is still unclear, especially in visual control settings. In this work, we study the URLB and propose a new method to solve it, using unsupervised model-based RL, for pre-training the agent, and a task-aware fine-tuning strategy combined with a new proposed hybrid planner, Dyna-MPC, to adapt the agent for downstream tasks. On URLB, our method obtains 93.59% overall normalized performance, surpassing previous baselines by a staggering margin. The approach is empirically evaluated through a large-scale empirical study, which we use to validate our design choices and analyze our models. We also show robust performance on the Real-Word RL benchmark, hinting at resiliency to environment perturbations during adaptation. Project website: https://masteringurlb.github.io/
研究动机与目标
- 为解决视觉控制任务中的数据效率挑战,通过提升无监督强化学习(URL)从像素输入中的泛化能力。
- 探究基于模型的无监督预训练是否能在复杂、基于像素的环境中有效支持下游任务的适应。
- 开发一种任务感知的适应策略,以提升在 URLB 基准上的微调效率与性能。
- 设计并评估一种混合规划器 Dyna-MPC,结合模型自由与基于模型的规划,以提升数据效率。
提出的方法
- 利用在无监督预训练期间通过自监督交互训练的世界模型,从像素中学习环境动力学。
- 采用一种任务感知的微调策略,对预训练的世界模型和智能体进行微调,同时从零开始训练评论家网络。
- 提出 Dyna-MPC,一种混合规划器,结合模型自由的 CEM 与学习到的智能体,以提升想象中的规划效率与性能。
- 通过超过 2,000 次大规模实验,验证设计选择并消融方法中的各个组件。
- 结合内在好奇心与潜在动力学建模(LDS),在预训练阶段引导探索。
- 采用类似 DreamerV2 的架构,结合离散潜在空间与循环动力学,实现高效的世界模型学习。
实验结果
研究问题
- RQ1基于模型的无监督预训练是否能显著提升基于像素的视觉控制任务中的泛化能力与数据效率?
- RQ2任务感知微调(包括对智能体与世界模型的选择性微调)对 URLB 上游性能的影响如何?
- RQ3像 Dyna-MPC 这类混合规划器相较于纯模型自由或纯基于模型的规划器,在性能提升方面有多大程度的贡献?
- RQ4所提出的方法是否能泛化到现实世界扰动,表明其在基准之外的鲁棒性?
- RQ5哪些关键设计选择能最大化无监督预训练与微调在视觉强化学习中的性能?
主要发现
- 所提方法在 URLB 上从像素输入实现 93.59% 的归一化性能,显著超越此前最先进方法。
- 无监督基于模型的预训练与任务感知微调相结合,相比仅使用 Plan2Explore(P2E)的方法,性能提升达 15.5%。
- Dyna-MPC 混合规划器相比仅使用任务感知微调的 P2E,性能提升 5.77%。
- 该方法对环境扰动表现出鲁棒性,在真实世界强化学习基准上展现出强大的泛化能力。
- 对预训练智能体进行微调,在稀疏奖励任务(如 Jaco 环境)中显著提升性能,尤其在奖励稀疏时效果更明显。
- 消融研究证实,所有组件——预训练、任务感知微调与 Dyna-MPC——对实现最佳性能均不可或缺。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。