[论文解读] Development of collective behavior in newborn artificial agents
本文提出,深度强化学习与好奇心驱动学习——两种受生物启发的机制——可使新生人工智能代理在自然环境中,仅从原始视觉输入中,无需外部奖励,自主发展出核心集体行为,如自我运动感知、物体识别和群体偏好。关键贡献在于证明,仅凭这些通用学习机制,即可从无监督、感官驱动的经验中生成复杂且适应性强的群体行为。
Collective behavior is widespread across the animal kingdom. To date, however, the developmental and mechanistic foundations of collective behavior have not been formally established. What learning mechanisms drive the development of collective behavior in newborn animals? Here, we used deep reinforcement learning and curiosity-driven learning -- two learning mechanisms deeply rooted in psychological and neuroscientific research -- to build newborn artificial agents that develop collective behavior. Like newborn animals, our agents learn collective behavior from raw sensory inputs in naturalistic environments. Our agents also learn collective behavior without external rewards, using only intrinsic motivation (curiosity) to drive learning. Specifically, when we raise our artificial agents in natural visual environments with groupmates, the agents spontaneously develop ego-motion, object recognition, and a preference for groupmates, rapidly learning all of the core skills required for collective behavior. This work bridges the divide between high-dimensional sensory inputs and collective action, resulting in a pixels-to-actions model of collective animal behavior. More generally, we show that two generic learning mechanisms -- deep reinforcement learning and curiosity-driven learning -- are sufficient to learn collective behavior from unsupervised natural experience.
研究动机与目标
- 探究新生人工代理如何在无预设规则或外部奖励的情况下发展集体行为。
- 探索生物上合理的学习机制——深度强化学习与好奇心驱动学习——是否足以支持人工代理中集体行为的涌现。
- 通过建模‘像素到动作’的学习过程,弥合高维感官输入与协调群体行为之间的鸿沟。
- 为研究集体动物行为的发展与机制基础,提供一种透明且神经上合理的框架。
提出的方法
- 代理通过深度强化学习进行训练,其内在奖励信号基于对视觉观察的预测误差最大化,以增强好奇心。
- 代理被嵌入一个具有群体同伴的自然主义3D视觉环境,实现从原始像素输入出发的无监督学习。
- 学习完全由内在动机(好奇心)驱动,不依赖外部奖励塑造或显式社会线索。
- 网络架构使用卷积神经网络处理视觉输入,策略网络生成动作,形成端到端的‘像素到动作’系统。
- 代理学会在不同视角下不变地识别群体同伴,并通过自我监督探索发展出对靠近群体的偏好。
- 训练环境采用程序化生成,以确保在多样化视觉与空间条件下的泛化能力。
实验结果
研究问题
- RQ1人工代理是否仅通过内在动机,无需外部奖励或预编程规则,即可从原始感官输入中发展出集体行为?
- RQ2哪些学习机制足以支持人工代理中自我运动感知、物体识别与群体偏好的自发涌现?
- RQ3深度强化学习与好奇心驱动学习如何协同作用,使无监督经验中发展出复杂社会行为?
- RQ4‘像素到动作’模型在多大程度上能复现新生动物中观察到的集体行为发展轨迹?
主要发现
- 人工代理自发发展出自我运动感知能力,在自然环境中通过视觉流动学习追踪自身运动。
- 代理学会不变的物体识别,无需显式监督即可在视角与视觉上下文变化下可靠识别群体同伴。
- 代理发展出对群体同伴的强烈接近偏好,导致自发形成群体并保持凝聚力。
- 所有集体行为的核心技能均无需外部奖励,完全由好奇心驱动的内在动机驱动。
- 代理行为与真实新生动物高度相似,展现出从原始视觉输入中快速、无监督地习得复杂社会技能的能力。
- 该模型表明,两种通用学习机制——深度强化学习与好奇心驱动学习——足以在人工代理中生成集体行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。