[论文解读] MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations
MoDem 提出了一种三阶段框架,通过仅利用五次专家示范,加速了基于视觉模型的强化学习。通过在示范数据上预训练策略、以专家优先的轨迹为世界模型提供种子数据,并在模型训练过程中大幅超采样示范数据,MoDem 在仅使用 100K 次环境交互的情况下,在稀疏奖励的视觉控制任务中,成功率达到先前方法的 160%–250%。
Poor sample efficiency continues to be the primary challenge for deployment of deep Reinforcement Learning (RL) algorithms for real-world applications, and in particular for visuo-motor control. Model-based RL has the potential to be highly sample efficient by concurrently learning a world model and using synthetic rollouts for planning and policy improvement. However, in practice, sample-efficient learning with model-based RL is bottlenecked by the exploration challenge. In this work, we find that leveraging just a handful of demonstrations can dramatically improve the sample-efficiency of model-based RL. Simply appending demonstrations to the interaction dataset, however, does not suffice. We identify key ingredients for leveraging demonstrations in model learning -- policy pretraining, targeted exploration, and oversampling of demonstration data -- which forms the three phases of our model-based RL framework. We empirically study three complex visuo-motor control domains and find that our method is 150%-250% more successful in completing sparse reward tasks compared to prior approaches in the low data regime (100K interaction steps, 5 demonstrations). Code and videos are available at: https://nicklashansen.github.io/modemrl
研究动机与目标
- 解决视觉模型强化学习(MBRL)在真实世界视觉-运动控制任务中样本效率低下的问题。
- 探究在标准回放缓冲区集成方法失效的情况下,少量专家示范如何加速 MBRL。
- 开发一种结构化的三阶段框架,有效利用示范数据以提升世界模型质量和策略学习。
- 证明在 MBRL 中,对示范数据进行激进的超采样以及基于示范的策略预训练,显著优于对示范数据的简单集成方式。
提出的方法
- 阶段 1:使用行为克隆(BC)在少量专家示范上预训练视觉表征和策略。
- 阶段 2:使用预训练策略进行探索,生成有针对性的、高质量的数据集,用于预训练世界模型和评论家。
- 阶段 3:通过合成轨迹和来自三个阶段的所有数据,联合微调策略和世界模型,同时对示范过渡进行激进的超采样。
- 在各阶段应用数据增强和权重共享,以正则化模型并提升泛化能力。
- 在联合优化过程中使用梯度截断操作,以解耦策略和世界模型的训练。
- 不仅将示范作为轨迹集成,更通过有针对性的数据采样,将其作为世界模型监督的核心组成部分。
实验结果
研究问题
- RQ1少量专家示范是否能显著提升视觉模型强化学习的样本效率?
- RQ2为何简单地将示范数据附加到回放缓冲区无法加速 MBRL?
- RQ3在 MBRL 中有效利用示范数据所需的架构和训练组件是什么?
- RQ4策略预训练以及基于预训练策略的针对性数据收集,如何改善世界模型和评论家的学习?
- RQ5数据增强和对示范数据的超采样在多大程度上能提升视觉 MBRL 的性能?
主要发现
- 在仅使用 100K 次环境交互和 5 次示范的情况下,MoDem 在 21 项具有挑战性的视觉-运动控制任务中,成功率达到先前最先进方法的 160%–250%。
- 简单地将示范数据附加到回放缓冲区会导致性能不佳,因为智能体无法有效利用行为先验。
- 三阶段框架——策略预训练、基于专家优先轨迹的种子数据生成、以及交互式微调——实现了稳定且单调的学习过程。
- 在世界模型训练期间对示范数据进行激进的超采样,显著提升了模型精度和下游策略的成功率。
- 数据增强和预训练的视觉表征降低了训练成本,并在低数据场景下提升了鲁棒性。
- 该方法在性能上远超模型无关基线,证明在稀疏奖励设置下,结合示范的 MBRL 比模型无关方法更具样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。