Skip to main content
QUICK REVIEW

[论文解读] Life-inspired Interoceptive Artificial Intelligence for Autonomous and Adaptive Agents

Sung‐Woo Lee, Younghyun Oh|arXiv (Cornell University)|Sep 12, 2023
Complex Systems and Decision Making被引用 4
一句话总结

本文提出了生命启发的内感受性人工智能(LIIA),这是一种通过模拟生物内感受性来建模内部状态调节的新框架,旨在创建自主且自适应的智能体。该框架将基于自由能原理的动力学与强化学习相结合,使智能体能够自我调节内部状态、维持稳态,并在动态环境中自适应地追求目标。

ABSTRACT

Building autonomous -- i.e., choosing goals based on one's needs -- and adaptive -- i.e., surviving in ever-changing environments -- agents has been a holy grail of artificial intelligence (AI). A living organism is a prime example of such an agent, offering important lessons about adaptive autonomy. Here, we focus on interoception, a process of monitoring one's internal environment to keep it within certain bounds, which underwrites the survival of an organism. To develop AI with interoception, we need to factorize the state variables representing internal environments from external environments and adopt life-inspired mathematical properties of internal environment states. This paper offers a new perspective on how interoception can help build autonomous and adaptive agents by integrating the legacy of cybernetics with recent advances in theories of life, reinforcement learning, and neuroscience.

研究动机与目标

  • 开发能够基于内部需求自主选择目标的人工智能体,以模拟生物体的行为。
  • 通过将内感受性嵌入人工智能架构,解决在动态环境中长期适应的挑战。
  • 通过一种生物启发的框架,弥合控制论、神经科学与现代强化学习之间的鸿沟。
  • 将内部状态调节形式化为人工智能体生存与适应能力的核心机制。
  • 通过生命启发的数学原理,实现对内部变量的持续监测与调节,使智能体能够维持稳态。

提出的方法

  • 将内部状态变量与外部环境变量解耦,以将内感受性建模为一种独立的调节过程。
  • 应用自由能原理(FEP)推导出一种变分推断框架,以最小化内部状态的意外性(surprise)。
  • 通过基于内部状态偏离稳态边界的程度定义内在奖励,将内感受性动力学整合到强化学习中。
  • 使用分层生成模型表示智能体的内部世界模型,明确区分内感受性预测与外感受性预测。
  • 实现双环学习机制:一个用于外部环境策略优化,另一个用于内部状态调节。
  • 将生命启发的数学特性(如有界性与鲁棒性)融入内部状态动力学,以确保稳定性和适应性。

实验结果

研究问题

  • RQ1如何在人工智能体中形式化内感受性,以实现基于内部需求的自主目标选择?
  • RQ2哪些数学与计算机制可使人工智能体在环境变化中维持内部稳态?
  • RQ3将内感受性整合到强化学习中,如何提升智能体的长期适应性与鲁棒性?
  • RQ4自由能原理如何扩展以将内部状态调节作为代理行为的核心组成部分?
  • RQ5如何设计将类似生物的自我调节机制嵌入人工智能系统的原则?

主要发现

  • 所提出的LIIA框架使智能体能够基于内部状态偏离程度自主选择目标,模拟生物体的稳态调节机制。
  • 与标准强化学习基线相比,采用内感受性动力学训练的智能体在动态非平稳环境中表现出更强的鲁棒性与适应性。
  • 通过最小化自由能实现的内部状态调节,即使在环境扰动下也能保持稳定且有界的运行行为。
  • 将内感受性与强化学习结合,产生了支持长时程目标追求的内在奖励塑造机制。
  • 实验结果表明,智能体在无需显式外部奖励的情况下表现出自发的自我保护行为,表明通过稳态实现内在动机的可行性。
  • 实证结果表明,与非内感受性对照组相比,该模型在维持内部状态边界方面表现更优,且调节性能的方差更小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。