Skip to main content
QUICK REVIEW

[论文解读] Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation

Nick Haber, Damian Mrowca|arXiv (Cornell University)|Feb 21, 2018
Psychological and Educational Research Studies被引用 11
一句话总结

该论文提出了一种在模拟的、物理基础的环境中基于好奇心的强化学习框架,其中智能体通过学习世界模型来预测动作结果,并通过对抗性策略寻求新颖且出人意料的交互。该系统在无需预定义奖励或预训练的情况下,自主生成结构化的视觉运动行为(如自我运动预测、物体注意力和物体收集),通过内在动机实现自监督的发育里程碑的涌现。

ABSTRACT

Infants are experts at playing, with an amazing ability to generate novel structured behaviors in unstructured environments that lack clear extrinsic reward signals. We seek to replicate some of these abilities with a neural network that implements curiosity-driven intrinsic motivation. Using a simple but ecologically naturalistic simulated environment in which the agent can move and interact with objects it sees, the agent learns a world model predicting the dynamic consequences of its actions. Simultaneously, the agent learns to take actions that adversarially challenge the developing world model, pushing the agent to explore novel and informative interactions with its environment. We demonstrate that this policy leads to the self-supervised emergence of a spectrum of complex behaviors, including ego motion prediction, object attention, and object gathering. Moreover, the world model that the agent learns supports improved performance on object dynamics prediction and localization tasks. Our results are a proof-of-principle that computational models of intrinsic motivation might account for key features of developmental visuomotor learning in infants.

研究动机与目标

  • 探究基于好奇心的内在动机是否能够驱动人工智能体在自监督下涌现出结构化、类似发育的行为。
  • 模拟婴儿如何通过内在探索而非预设奖励或内置世界模型来学习视觉运动技能。
  • 开发一种计算框架,使世界模型的准确性与探索策略通过对抗性交互共同进化。
  • 证明内在动机能够提升世界模型在下游任务(如物体动力学预测和定位)上的性能。
  • 为自主智能体如何通过好奇心自组织学习提供原理性验证,模拟婴儿游戏与认知发育过程。

提出的方法

  • 智能体使用一个世界模型(神经网络)来预测其在模拟三维环境中的动作所导致的视觉结果。
  • 一个独立的损失模型估计世界模型在若干步之后的预测误差,以识别能最大化惊奇感和新颖性的动作。
  • 智能体的策略通过选择能对抗性地挑战世界模型的动作来训练,从而促进对未预期状态的探索。
  • 该系统在未使用ImageNet或其他大规模分类数据集进行预训练的情况下运行,完全依赖自监督交互。
  • 世界模型被训练为从当前观测和动作预测未来观测,从而实现对自我运动和物体动力学的预测。
  • 损失模型通过选择导致高预测误差的动作来驱动探索,形成一个反馈回路,持续扩展智能体的行为与表征库。

实验结果

研究问题

  • RQ1仅靠内在好奇心是否足以驱动模拟智能体自发涌现出结构化、复杂的行为(如物体注意力和收集)?
  • RQ2通过好奇心驱动探索训练的世界模型,在物体动力学预测和定位等下游任务上的性能提升程度如何?
  • RQ3世界模型与对抗性损失模型之间的交互如何在无显式奖励的情况下促成自监督的发育里程碑?
  • RQ4在物理基础环境中基于好奇心的学习是否能自发涌现出自我运动预测和物体恒存行为?
  • RQ5缺乏在大规模数据集上的预训练是否阻碍或促进人工智能体实现更自然、类似发育的学习?

主要发现

  • 智能体通过内在探索自发发展出自我运动预测能力,学会预测自身运动引起的视觉场变化。
  • 智能体学会选择性地关注并定位物体,即使在没有显式物体检测或识别模块的情况下。
  • 当存在多个物体时,智能体学会将它们聚集到可交互范围内,表现出目标导向行为而无需显式奖励设计。
  • 通过好奇心训练的世界模型在下游任务(如物体动力学预测和定位)上的性能得到提升,尽管这些任务并非内在学习目标的一部分。
  • 该系统在未使用ImageNet或其他大规模视觉数据集进行预训练的情况下实现上述行为,支持通过交互实现自监督视觉表征学习的可行性。
  • 智能体表现出一种自适应课程化形式,随着世界模型的改进,其行为逐步经历不同的发育里程碑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。