Skip to main content
QUICK REVIEW

[论文解读] Discovering and Achieving Goals via World Models

Russell Mendonca, Oleh Rybkin|arXiv (Cornell University)|Oct 18, 2021
Multimodal Machine Learning Applications被引用 7
一句话总结

LEXA 是一种无监督强化学习智能体,利用学习到的世界模型在想象中训练独立的探索者和执行者策略。通过规划新颖的、高信息增益的状态,它在无监督条件下发现多样化的目标,并能零样本地从目标图像中实现这些目标,在包含复杂多物体任务的操控和运动环境上的新40项任务基准测试中,性能优于先前方法。

ABSTRACT

How can artificial agents learn to solve many diverse tasks in complex visual environments in the absence of any supervision? We decompose this question into two problems: discovering new goals and learning to reliably achieve them. We introduce Latent Explorer Achiever (LEXA), a unified solution to these that learns a world model from image inputs and uses it to train an explorer and an achiever policy from imagined rollouts. Unlike prior methods that explore by reaching previously visited states, the explorer plans to discover unseen surprising states through foresight, which are then used as diverse targets for the achiever to practice. After the unsupervised phase, LEXA solves tasks specified as goal images zero-shot without any additional learning. LEXA substantially outperforms previous approaches to unsupervised goal-reaching, both on prior benchmarks and on a new challenging benchmark with a total of 40 test tasks spanning across four standard robotic manipulation and locomotion domains. LEXA further achieves goals that require interacting with multiple objects in sequence. Finally, to demonstrate the scalability and generality of LEXA, we train a single general agent across four distinct environments. Code and videos at https://orybkin.github.io/lexa/

研究动机与目标

  • 使人工智能智能体能够在复杂视觉环境中无监督地学习多样化技能。
  • 解决无监督目标条件强化学习中的高效探索挑战。
  • 在无监督预训练后,实现对用户指定目标图像的零样本泛化。
  • 开发一种可扩展的框架,从原始视觉输入中学习复杂的操控和运动行为。
  • 引入一个包含40项多样化任务的新基准,用于评估无监督目标达成智能体。

提出的方法

  • LEXA 使用变分自编码器和动力学模型,从原始图像观测中学习世界模型。
  • 探索者策略在想象中规划,通过最大化世界模型上的期望信息增益,发现新颖且高信息增益的状态。
  • 发现的状态被用作训练执行者策略的多样化目标,通过在世界模型内进行在线策略滚动实现。
  • 执行者策略使用基于预见性的滚动进行训练,避免经验重标记,并利用想象中的轨迹。
  • 学习到的距离函数用于衡量状态与目标之间的可达性成本,通过在线策略经验在想象中进行优化。
  • 该框架在推理阶段仅使用目标图像即可实现零样本目标达成,无需进一步学习或奖励塑形。

实验结果

研究问题

  • RQ1智能体是否能在复杂视觉环境中无任何奖励或监督的情况下发现有意义且未见过的目标?
  • RQ2在学习到的世界模型中基于预见性的规划是否能显著提升探索效率,相比先前方法?
  • RQ3单个预训练的执行者策略是否能在推理阶段对多样化的用户指定目标图像实现零样本泛化,而无需额外微调?
  • RQ4无监督世界模型基训练是否能实现在复杂多物体操控和运动任务中的成功?
  • RQ5LEXA 在具有挑战性且多样化的基准测试中,与先前无监督目标达成方法相比表现如何?

主要发现

  • LEXA 在先前的无监督目标达成基准测试中达到最先进性能,显著优于之前方法。
  • LEXA 是首个成功解决 RoboKitchen 环境(一个具有挑战性的多物体操控基准)任务的智能体。
  • LEXA 在四个机器人操控和运动领域中的40项多样化测试任务上均取得成功,包括对多个物体的复杂顺序交互。
  • 基于想象的探索方法相比依赖经验回放缓冲区状态或生成模型的先前方法,实现了更丰富且更有效的目标发现。
  • 执行者策略在推理阶段对训练期间未见过的目标图像实现了零样本泛化,且无需任何奖励塑形或微调。
  • LEXA 在高维控制任务中表现稳健,包括在 RoboYoga 中的精确控制以及在 RoboBins 中的多物体操控。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。