Skip to main content
QUICK REVIEW

[论文解读] Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills

Yevgen Chebotar, Karol Hausman|arXiv (Cornell University)|Apr 15, 2021
Reinforcement Learning in Robotics参考文献 49被引用 16
一句话总结

本文提出 Actionable Models,一种从离线、真实世界机器人数据中学习目标条件策略的方法,无需奖励函数或在线交互。通过使用基于回溯重标注的目标条件Q-learning与合成负动作正则化,该方法实现了对未见任务的零样本泛化、长时程目标链式组合,以及通过在真实机器人上使用图像观测进行预训练或辅助目标,提升下游强化学习性能。

ABSTRACT

We consider the problem of learning useful robotic skills from previously collected offline data without access to manually specified rewards or additional online exploration, a setting that is becoming increasingly important for scaling robot learning by reusing past robotic data. In particular, we propose the objective of learning a functional understanding of the environment by learning to reach any goal state in a given dataset. We employ goal-conditioned Q-learning with hindsight relabeling and develop several techniques that enable training in a particularly challenging offline setting. We find that our method can operate on high-dimensional camera images and learn a variety of skills on real robots that generalize to previously unseen scenes and objects. We also show that our method can learn to reach long-horizon goals across multiple episodes through goal chaining, and learn rich representations that can help with downstream tasks through pre-training or auxiliary objectives. The videos of our experiments can be found at https://actionable-models.github.io

研究动机与目标

  • 在无需人工奖励或在线探索的情况下,从先前收集的离线数据中学习多样化的机器人技能。
  • 开发一种通用的训练目标,通过将数据集中每个状态视为潜在目标,自动合成多样化任务。
  • 通过为未见动作引入合成负标签,在离线、目标条件的强化学习设置中稳定训练过程。
  • 通过跨多个episode的目标链式组合,实现长时程技能学习。
  • 证明通过微调或辅助目标,预训练的 Actionable Models 可加速下游任务学习。

提出的方法

  • 采用基于回溯重标注的目标条件Q-learning训练策略,使其能够到达数据集中任意目标状态。
  • 引入一种正则化技术,为未见动作分配低Q值,缓解离线强化学习中的分布偏移与值函数过估计问题。
  • 使用基于图像的观测作为状态和目标输入,避免依赖人工设计的奖励函数或距离度量。
  • 通过将中间目标作为路标,在多个episode之间链式组合目标,实现长时程技能学习。
  • 将预训练的目标条件策略用作下游任务学习的预训练或辅助目标。
  • 通过少量在线数据和任务特定奖励对预训练模型进行微调,提升样本效率。

实验结果

研究问题

  • RQ1在未手动指定奖励的情况下,能否成功在离线、真实世界机器人数据上训练目标条件强化学习?
  • RQ2在无在线交互的情况下,如何缓解离线目标条件强化学习中的分布偏移与过估计问题?
  • RQ3单个模型能否从单一离线数据集中学习到多样且可泛化的技能?
  • RQ4目标链式组合是否能使智能体达成跨越多个episode、超过数据集中最长轨迹的目标?
  • RQ5通过微调或辅助目标,预训练的 Actionable Models 在多大程度上能加速下游任务学习?

主要发现

  • 在微调少于10,000个episode后,该方法在三个真实世界实例抓取任务中均实现了至少20%的成功率,而标准的离线QT-Opt成功率低于5%。
  • 通过目标达成目标进行预训练,在仿真和真实世界设置中均显著加速了下游强化学习的训练过程。
  • 在在线训练期间引入辅助目标达成目标可提升样本效率,相比标准QT-Opt,学习时间更短。
  • 该模型能泛化到未见过的场景和物体,展示了从视觉指示目标出发的零样本泛化能力。
  • 目标链式组合使智能体能够通过整合多个episode中的数据集片段,达成长时程目标。
  • Actionable Models 学习到的表征作为下游任务的有效特征,当用作预训练或辅助目标时,可提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。