Skip to main content
QUICK REVIEW

[论文解读] Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation

Cansu Sancaktar, Sebastian Blaes|arXiv (Cornell University)|Jun 22, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

该论文提出 CEE-US 方法,通过结合图神经网络集成的结构化世界模型,实现多物体操作中的样本高效、好奇心驱动探索。通过规划以减少认知不确定性(基于模型分歧),智能体实现了丰富的交互行为,并在无需进一步训练的情况下零样本泛化至未见任务(如堆叠、翻转和投掷)。

ABSTRACT

It has been a long-standing dream to design artificial agents that explore their environment efficiently via intrinsic motivation, similar to how children perform curious free play. Despite recent advances in intrinsically motivated reinforcement learning (RL), sample-efficient exploration in object manipulation scenarios remains a significant challenge as most of the relevant information lies in the sparse agent-object and object-object interactions. In this paper, we propose to use structured world models to incorporate relational inductive biases in the control loop to achieve sample-efficient and interaction-rich exploration in compositional multi-object environments. By planning for future novelty inside structured world models, our method generates free-play behavior that starts to interact with objects early on and develops more complex behavior over time. Instead of using models only to compute intrinsic rewards, as commonly done, our method showcases that the self-reinforcing cycle between good models and good exploration also opens up another avenue: zero-shot generalization to downstream tasks via model-based planning. After the entirely intrinsic task-agnostic exploration phase, our method solves challenging downstream tasks such as stacking, flipping, pick & place, and throwing that generalizes to unseen numbers and arrangements of objects without any additional training.

研究动机与目标

  • 通过内在好奇心实现组合式多物体环境中的样本高效、交互丰富的探索。
  • 解决现有内在奖励方法在稀疏操作场景中无法优先关注信息量丰富的交互的局限性。
  • 通过图神经网络利用关系归纳偏置,提升探索质量与下游任务泛化能力。
  • 仅通过内在探索阶段,实现对未见物体数量与排列的零样本泛化。
  • 通过基于模型的规划,建立模型学习与探索之间的自我强化循环。

提出的方法

  • 该方法采用图神经网络(GNN)集合,将物体建模为具有关系交互的节点,以表征其前向动力学。
  • 通过 GNN 集合成员之间的分歧计算认知不确定性,生成内在好奇心奖励。
  • 在线规划算法利用结构化世界模型,选择能最大化未来认知不确定性减少的动作。
  • 智能体通过不确定性引导的主动探索收集数据,用于迭代优化世界模型。
  • 在任务无关的内在阶段之后,所学模型可利用基于模型的强化学习实现下游任务的零样本规划。
  • 该方法仅使用本体感觉状态观测,不依赖图像观测或类似 RND 的独立内在奖励模块。

实验结果

研究问题

  • RQ1具有关系归纳偏置的结构化世界模型是否能提升多物体操作中好奇心驱动探索的样本效率?
  • RQ2与标准内在奖励方法相比,通过规划减少认知不确定性是否能带来更具信息量和交互丰富的探索?
  • RQ3仅通过内在好奇心训练的模型是否能零样本泛化至多样化的下游操作任务,包括未见物体数量的任务?
  • RQ4通过 GNN 集成分歧的不确定性探索,与 RND 或 ICM 等替代内在奖励机制相比表现如何?
  • RQ5基于模型的规划在内在探索阶段后,能在多大程度上提升下游任务性能?

主要发现

  • CEE-US 在下游任务(如抓取与放置、堆叠、翻转和投掷)上的成功率显著高于使用 RND 或 ICM 作为内在奖励的基线方法。
  • 在 4 个物体的抓取与放置任务中,CEE-US 比其基于 RND 的对应方法更快达到更高性能,展现出更优的样本效率。
  • 在 RoboDesk 环境中,CEE-US 在打开抽屉任务上的成功率为 0.97 ± 0.02,在打开滑动柜任务上的成功率为 0.87 ± 0.07,展现出强大的零样本泛化能力。
  • 尽管 GNN + RND 变体收集了更多空中物体的数据,其任务成功率仍低于 CEE-US,表明基于不确定性的探索能收集到更有用的数据。
  • CEE-US 在交互丰富度与下游任务性能方面均优于 MLP + iCEM 及其他基线方法,尤其在需要复杂物体操作的任务中表现更优。
  • 模型学习与探索之间的自我强化循环使智能体在无任何外在奖励信号的情况下,发展出翻转和堆叠等复杂行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。