Skip to main content
QUICK REVIEW

[论文解读] Learning in embodied action-perception loops through exploration

Daniel Y. Little, Friedrich T. Sommer|arXiv (Cornell University)|Dec 6, 2011
Neural dynamics and brain function参考文献 39被引用 11
一句话总结

本文提出了一种基于贝叶斯推断量化缺失信息的计算理论,用于具身智能体的学习驱动型探索,实现了高效的动作-感知回路协调。通过优先选择能减少不确定性的动作,该模型在导航和奖励获取任务中实现了比以往方法更快的世界学习速度和更优的任务表现。

ABSTRACT

Although exploratory behaviors are ubiquitous in the animal kingdom, their computational underpinnings are still largely unknown. Behavioral Psychology has identified learning as a primary drive underlying many exploratory behaviors. Exploration is seen as a means for an animal to gather sensory data useful for reducing its ignorance about the environment. While related problems have been addressed in Data Mining and Reinforcement Learning, the computational modeling of learning-driven exploration by embodied agents is largely unrepresented. Here, we propose a computational theory for learning-driven exploration based on the concept of missing information that allows an agent to identify informative actions using Bayesian inference. We demonstrate that when embodiment constraints are high, agents must actively coordinate their actions to learn efficiently. Compared to earlier approaches, our exploration policy yields more efficient learning across a range of worlds with diverse structures. The improved learning in turn affords greater success in general tasks including navigation and reward gathering. We conclude by discussing how the proposed theory relates to previous information-theoretic objectives of behavior, such as predictive information and the free energy principle, and how it might contribute to a general theory of exploratory behavior.

研究动机与目标

  • 弥合行为心理学中将学习视为探索主要驱动力的观点与计算模型中以奖励最大化为重点之间的差距。
  • 建立一个正式框架,说明具身智能体如何通过闭环动作-感知回路中的协调动作主动学习世界结构。
  • 证明通过缺失信息最大化信息增益可缩短学习时间,并在多样化环境中提升性能。
  • 将所提出的基于学习的探索与现有信息论原理(如预测信息和自由能)联系起来,提出一种统一的探索行为理论。

提出的方法

  • 智能体在可控马尔可夫链(CMC)世界中运行,其中动作影响状态转移,通过贝叶斯推断学习转移动态。
  • 探索策略由预期缺失信息的减少量(即预测信息增益)驱动,用于量化某一动作预期能消除多少不确定性。
  • 选择使预期信息增益(PIG)最大化的动作,PIG计算为内部模型对世界动态信念的熵减少的期望值。
  • 通过要求智能体学习动作如何影响感官输入,整合了感官运动一致性,从而实现主动数据采集。
  • 在多种结构复杂度不同的世界中,将该方法与基线探索策略(包括随机策略和基于奖励的策略)进行对比。
  • 提出一种结合学习驱动与刺激驱动探索的混合策略,与心理学中对探索中“探究”与“游戏”的区分相一致。

实验结果

研究问题

  • RQ1如何将探索的计算模型建立在学习作为主要驱动力的基础上,而非奖励最大化?
  • RQ2具身约束在何种程度上要求动作协调,以实现在动作-感知回路中的高效学习?
  • RQ3与其它探索策略相比,最大化预测信息增益(PIG)在学习速度和任务成功率方面表现如何?
  • RQ4所提出的理论如何与现有信息论原理(如预测信息和自由能)相联系?
  • RQ5能否在一个统一的计算框架中整合不同探索模式(如探究与游戏)?

主要发现

  • 基于预测信息增益(PIG)的所提学习驱动型探索策略,在多样化环境中显著优于随机探索和基于奖励的探索,在学习底层世界结构方面表现更优。
  • 在高具身约束的情境下,基于缺失信息的协调动作选择相比非协调策略,能更快收敛于世界动态的学习。
  • 更优的世界学习带来了导航和奖励获取等通用任务的成功率提升,证明了高效探索的下游优势。
  • 该模型的探索策略与心理学中以好奇心驱动的探究理论一致,即动作选择旨在减少对世界的不确定性。
  • 该框架为信息论概念(如熵、信息增益)与探索行为之间提供了原则性联系,支持了自主学习的统一理论。
  • 结合学习驱动与刺激驱动模式的混合探索策略,捕捉到了发展心理学中观察到的从探究到游戏的过渡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。