Skip to main content
QUICK REVIEW

[论文解读] MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations

Nicklas Hansen, Yixin Lin|arXiv (Cornell University)|Dec 12, 2022
Reinforcement Learning in Robotics被引用 8
一句话总结

MoDem 提出了一种三阶段框架,通过仅利用五次专家示范,加速了基于视觉模型的强化学习。通过在示范数据上预训练策略、以专家优先的轨迹为世界模型提供种子数据,并在模型训练过程中大幅超采样示范数据,MoDem 在仅使用 100K 次环境交互的情况下,在稀疏奖励的视觉控制任务中,成功率达到先前方法的 160%–250%。

ABSTRACT

Poor sample efficiency continues to be the primary challenge for deployment of deep Reinforcement Learning (RL) algorithms for real-world applications, and in particular for visuo-motor control. Model-based RL has the potential to be highly sample efficient by concurrently learning a world model and using synthetic rollouts for planning and policy improvement. However, in practice, sample-efficient learning with model-based RL is bottlenecked by the exploration challenge. In this work, we find that leveraging just a handful of demonstrations can dramatically improve the sample-efficiency of model-based RL. Simply appending demonstrations to the interaction dataset, however, does not suffice. We identify key ingredients for leveraging demonstrations in model learning -- policy pretraining, targeted exploration, and oversampling of demonstration data -- which forms the three phases of our model-based RL framework. We empirically study three complex visuo-motor control domains and find that our method is 150%-250% more successful in completing sparse reward tasks compared to prior approaches in the low data regime (100K interaction steps, 5 demonstrations). Code and videos are available at: https://nicklashansen.github.io/modemrl

研究动机与目标

  • 解决视觉模型强化学习(MBRL)在真实世界视觉-运动控制任务中样本效率低下的问题。
  • 探究在标准回放缓冲区集成方法失效的情况下,少量专家示范如何加速 MBRL。
  • 开发一种结构化的三阶段框架,有效利用示范数据以提升世界模型质量和策略学习。
  • 证明在 MBRL 中,对示范数据进行激进的超采样以及基于示范的策略预训练,显著优于对示范数据的简单集成方式。

提出的方法

  • 阶段 1:使用行为克隆(BC)在少量专家示范上预训练视觉表征和策略。
  • 阶段 2:使用预训练策略进行探索,生成有针对性的、高质量的数据集,用于预训练世界模型和评论家。
  • 阶段 3:通过合成轨迹和来自三个阶段的所有数据,联合微调策略和世界模型,同时对示范过渡进行激进的超采样。
  • 在各阶段应用数据增强和权重共享,以正则化模型并提升泛化能力。
  • 在联合优化过程中使用梯度截断操作,以解耦策略和世界模型的训练。
  • 不仅将示范作为轨迹集成,更通过有针对性的数据采样,将其作为世界模型监督的核心组成部分。

实验结果

研究问题

  • RQ1少量专家示范是否能显著提升视觉模型强化学习的样本效率?
  • RQ2为何简单地将示范数据附加到回放缓冲区无法加速 MBRL?
  • RQ3在 MBRL 中有效利用示范数据所需的架构和训练组件是什么?
  • RQ4策略预训练以及基于预训练策略的针对性数据收集,如何改善世界模型和评论家的学习?
  • RQ5数据增强和对示范数据的超采样在多大程度上能提升视觉 MBRL 的性能?

主要发现

  • 在仅使用 100K 次环境交互和 5 次示范的情况下,MoDem 在 21 项具有挑战性的视觉-运动控制任务中,成功率达到先前最先进方法的 160%–250%。
  • 简单地将示范数据附加到回放缓冲区会导致性能不佳,因为智能体无法有效利用行为先验。
  • 三阶段框架——策略预训练、基于专家优先轨迹的种子数据生成、以及交互式微调——实现了稳定且单调的学习过程。
  • 在世界模型训练期间对示范数据进行激进的超采样,显著提升了模型精度和下游策略的成功率。
  • 数据增强和预训练的视觉表征降低了训练成本,并在低数据场景下提升了鲁棒性。
  • 该方法在性能上远超模型无关基线,证明在稀疏奖励设置下,结合示范的 MBRL 比模型无关方法更具样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。