Skip to main content
QUICK REVIEW

[论文解读] Latent Plans for Task-Agnostic Offline Reinforcement Learning

Erick Rosete-Beas, Oier Mees|arXiv (Cornell University)|Sep 19, 2022
Human Pose and Action Recognition被引用 5
一句话总结

该论文提出TACO-RL,一种分层的离线强化学习框架,结合模仿学习从非结构化操作数据中发现潜在技能,并利用离线强化学习实现高层技能链式组合,以实现与任务无关的长时程机器人控制。通过从遥操作演示中学习潜在计划,并使用事后重标记(hindsight relabeling)训练目标条件化的高层策略,TACO-RL在仿真和真实世界操作任务中均实现了相较于最先进基线方法一个数量级的性能提升,包括使用单一7-DoF策略解决25项多样化的真实世界任务。

ABSTRACT

Everyday tasks of long-horizon and comprising a sequence of multiple implicit subtasks still impose a major challenge in offline robot control. While a number of prior methods aimed to address this setting with variants of imitation and offline reinforcement learning, the learned behavior is typically narrow and often struggles to reach configurable long-horizon goals. As both paradigms have complementary strengths and weaknesses, we propose a novel hierarchical approach that combines the strengths of both methods to learn task-agnostic long-horizon policies from high-dimensional camera observations. Concretely, we combine a low-level policy that learns latent skills via imitation learning and a high-level policy learned from offline reinforcement learning for skill-chaining the latent behavior priors. Experiments in various simulated and real robot control tasks show that our formulation enables producing previously unseen combinations of skills to reach temporally extended goals by "stitching" together latent skills through goal chaining with an order-of-magnitude improvement in performance upon state-of-the-art baselines. We even learn one multi-task visuomotor policy for 25 distinct manipulation tasks in the real world which outperforms both imitation learning and offline reinforcement learning techniques.

研究动机与目标

  • 为解决在离线强化学习中从高维视觉观测学习长时程、与任务无关策略的挑战。
  • 克服现有离线强化学习方法在长时程和高维状态空间中表现不佳的局限性。
  • 利用通过遥操作收集的非结构化游戏数据——在无预设任务的情况下——通过自监督模仿学习发现可重用的潜在技能。
  • 通过高层目标条件化策略组合学习到的潜在行为,实现对未见目标状态和复杂序列任务的泛化能力。
  • 在仿真和真实世界机器人操作任务中,相比独立的模仿学习和离线强化学习基线方法,实现更优性能。

提出的方法

  • 利用非结构化的遥操作游戏数据,通过模仿学习预训练低层策略,将潜在计划映射为运动动作。
  • 学习分层策略,其中高层策略在潜在计划空间中运作,输出离散或连续的潜在技能,由低层策略解码。
  • 使用带有事后经验回放(HER)的离线强化学习训练高层策略,以重标记转换并提升样本效率。
  • 采用目标条件化设定,使高层策略预测通往目标状态的潜在计划,从而降低强化学习问题的有效时域。
  • 通过事后重标记增强离线数据集,以提升泛化能力,并支持从非最优或次优轨迹中学习。
  • 引入夹爪-相机RGB图像作为额外输入,以改善视觉定位并减少真实世界部署中的遮挡问题。

实验结果

研究问题

  • RQ1分层离线强化学习框架能否有效从非结构化游戏数据中学习与任务无关的长时程策略?
  • RQ2将模仿学习用于潜在技能发现,与离线强化学习用于技能链式组合相结合,能否在长时程任务中超越最先进水平的模仿学习与离线强化学习方法?
  • RQ3该模型在仿真和真实世界中对未见目标状态及复杂序列操作任务的泛化能力如何?
  • RQ4事后重标记的使用在多大程度上提升了高层策略训练的样本效率和性能?
  • RQ5能否仅使用未标注的游戏数据,训练出一个单一的多任务视觉-运动策略,以解决多样化且长时程的操作任务?

主要发现

  • TACO-RL在25项真实世界操作任务中实现了平均61%的成功率,显著优于LMP(40%)和CQL+HER(11%)基线方法。
  • 在真实世界实验中,TACO-RL在“关闭抽屉”任务中达到90%的成功率,在“将滑块向左移动”任务中达到75%的成功率,大幅超越基线方法。
  • 该方法展现出强大的零样本泛化能力,仅使用单张目标图像,成功执行了如堆叠积木和将积木移动至远距离位置等复杂序列任务。
  • 在仿真环境中,TACO-RL在长时程任务上相较最先进基线方法实现了最高达一个数量级的性能提升。
  • 该模型对未见目标图像具有良好的泛化能力,尤其在需要多步推理或长时程规划的场景中表现优异。
  • 事后重标记与潜在计划表示的结合,使得即使在原始数据集包含次优或非目标导向轨迹的情况下,也能实现有效的技能链式组合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。