Skip to main content
QUICK REVIEW

[论文解读] From pixels to planning: scale-free active inference

Karl Friston, Conor Heins|arXiv (Cornell University)|Jul 27, 2024
Computability, Logic, AI Algorithms被引用 4
一句话总结

本文提出了归一化生成模型(RGMs),一种尺度不变、离散状态空间框架,通过将路径视为隐变量,扩展了部分可观测马尔可夫决策过程。结合变分推断与重整化群原理,RGMs 实现了跨空间与时间的组合性、层次化表征的端到端学习——在图像分类、视频/音乐生成及类似 Atar i 环境的规划任务中得到验证,实现了无架构偏置的、尺度自由的层次化推理。

ABSTRACT

This paper describes a discrete state-space model -- and accompanying methods -- for generative modelling. This model generalises partially observed Markov decision processes to include paths as latent variables, rendering it suitable for active inference and learning in a dynamic setting. Specifically, we consider deep or hierarchical forms using the renormalisation group. The ensuing renormalising generative models (RGM) can be regarded as discrete homologues of deep convolutional neural networks or continuous state-space models in generalised coordinates of motion. By construction, these scale-invariant models can be used to learn compositionality over space and time, furnishing models of paths or orbits; i.e., events of increasing temporal depth and itinerancy. This technical note illustrates the automatic discovery, learning and deployment of RGMs using a series of applications. We start with image classification and then consider the compression and generation of movies and music. Finally, we apply the same variational principles to the learning of Atari-like games.

研究动机与目标

  • 开发一种尺度不变、层次化的生成模型,支持长程时空组合性。
  • 通过在离散状态空间框架中将轨迹视为隐变量,统一感知与规划,实现主动推理。
  • 实现对感官数据(图像、视频、音乐、游戏)中组合结构的自动发现与学习,且无架构归纳偏置。
  • 在多样化领域中展示该框架的适用性——从静态图像分类到类似 Atar i 环境的动态序列决策制定。
  • 通过受重整化群启发的层次抽象,建立深度学习架构与主动推理之间的正式联系。

提出的方法

  • 提出一种离散状态空间模型,其中隐变量表示路径或轨迹,扩展了部分可观测马尔可夫决策过程。
  • 采用变分推断与自由能最小化方法,对隐路径与状态进行近似贝叶斯推断。
  • 应用重整化群(RG)原理,对空间与时间尺度上的表征进行分层粗粒化。
  • 使用分层多级生成模型,通过迭代粗粒化与重建学习组合特征。
  • 将框架整合为统一的主动推理引擎,通过路径推理同时支持感知与规划。
  • 利用广义运动坐标建模连续动力学,实现离散、尺度不变的表示。

实验结果

研究问题

  • RQ1一个单一的、无尺度生成模型能否在图像、视频、音乐与游戏环境等多样化模态中学习到层次化表征?
  • RQ2如何在生成模型中将路径或轨迹推理作为隐变量嵌入,以同时支持感知与规划?
  • RQ3在无架构偏置的前提下,重整化群原理在构建层次化、组合性结构表征方面可达到何种程度?
  • RQ4同一变分推断框架能否同时支持动态环境中生成建模与决策制定?
  • RQ5该模型的尺度不变性如何实现跨不同时间与空间尺度的鲁棒学习与泛化?

主要发现

  • RGM 框架成功从原始像素中学习到层次化、组合性表征,实现了最小归纳偏置的端到端图像分类。
  • 通过路径推理学习长程时间依赖,模型在视频与音乐序列的压缩与生成方面表现出色。
  • 在类似 Atar i 的环境中,模型通过推断最优动作序列(路径)最小化自由能,实现规划,展示了决策制定中的主动推理。
  • 分层结构支持无尺度推理,较粗层级的表征捕捉抽象的长程动态,而更细层级则保留局部细节。
  • 由于其内在的尺度与分辨率不变性,该框架对分布偏移具有鲁棒性,并展现出跨任务的泛化能力。
  • 利用重整化群原理,可在多个时间与空间分辨率层级上实现系统性抽象,模仿深层网络的层次结构,而无需固定架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。