[论文解读] Active Inference or Control as Inference? A Unifying View
本文通过将主动推理(AI)重新表述为部分可观测的控制即推理(CaI)问题,统一了主动推理(AI)与控制即推理(CaI),其中控制目标被建模为概率观测模型。研究证明,AI中的自由能最小化等价于通过变分推理实现的最优控制,从而通过近似推理实现了原则性、可扩展且具备不确定性感知能力的感知运动控制。
Active inference (AI) is a persuasive theoretical framework from computational neuroscience that seeks to describe action and perception as inference-based computation. However, this framework has yet to provide practical sensorimotor control algorithms that are competitive with alternative approaches. In this work, we frame active inference through the lens of control as inference (CaI), a body of work that presents trajectory optimization as inference. From the wider view of `probabilistic numerics', CaI offers principled, numerically robust optimal control solvers that provide uncertainty quantification, and can scale to nonlinear problems with approximate inference. We show that AI may be framed as partially-observed CaI when the cost function is defined specifically in the observation states.
研究动机与目标
- 通过控制即推理(CaI)的视角重新诠释主动推理,以解决其理论与算法实现上的模糊性。
- 为感知运动控制提供一种计算上可行且理论基础坚实的框架,保留AI的洞察力的同时支持实际实现。
- 通过变分推理与自由能最小化,将状态估计与控制统一于单一概率推理框架之下。
- 证明主动推理可重新表述为具备原则性推理与不确定性量化的部分可观测最优控制问题。
- 基于CaI稳健的数值基础,利用诸如序列蒙特卡洛与变分推理等近似推理方法,实现可扩展的非线性控制。
提出的方法
- 将主动推理重新表述为部分可观测的控制即推理(CaI)问题,其中控制目标被编码为概率观测模型。
- 使用变分推理最小化变分近似与真实后验之间的KL散度,从而得到边际似然的下界(ELBO)。
- 将自由能目标表达为两项之和:过去时间步的状态估计与未来时间步的最优控制,采用时变观测模型。
- 引入时变观测模型,使似然函数在规划时域τ处从测量保真度(估计)切换为基于代价的似然(控制)。
- 应用近似推理技术(如序列蒙特卡洛与高斯近似)以处理非线性与非高斯系统。
- 推导出统一的目标函数(公式15),通过单一变分自由能最小化实现过去状态估计与未来控制的联合优化。
实验结果
研究问题
- RQ1能否形式化地将主动推理重新解释为控制即推理(CaI)问题,以提升计算清晰度与实用性?
- RQ2主动推理中的自由能原理如何映射为具备不确定性量化的原则性最优控制公式?
- RQ3观测模型在统一概率推理框架下同时实现状态估计与控制的过程中起到何种作用?
- RQ4时变观测模型如何在统一框架中实现从状态估计到轨迹优化的无缝过渡?
- RQ5所提出的统一框架能否通过近似推理实现可扩展的非线性控制,同时保持理论严谨性?
主要发现
- 主动推理在形式上等价于一个部分可观测的控制即推理问题,其中控制目标被编码为概率观测模型。
- 所提出的框架通过时变观测模型(在规划时域τ处从测量保真度切换为基于代价的似然)将状态估计与控制统一于单一变分自由能目标之下。
- 在线性高斯情况下,该方法恢复了最优线性二次调节器(LQR)解,表明其与经典控制理论的一致性。
- 通过原则性的贝叶斯推理实现不确定性量化与鲁棒性,同时借助近似推理方法实现对非线性系统的可扩展性。
- 通过联合推断状态与控制 $ q_{\bm{\theta}}({\bm{x}}_t, {\bm{u}}_t) $,相比直接在任意策略类上进行策略搜索,能获得更优的策略。
- 由于其基于概率数值方法与稳健优化的理论基础,该方法在计算清晰度与实际可实现性方面优于标准主动推理,尤其在非线性和高维设置下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。