[论文解读] On Kalman-Bucy filters, linear quadratic control and active inference
本文比较了连续时间线性系统中的线性二次高斯(LQG)控制与主动推理,揭示了二者在贝叶斯推断与最优控制中的共同数学基础,同时突出了其在代价泛函、估计策略及实现假设方面的关键差异。核心贡献在于对两种框架的正式映射,表明主动推理通过将推断与控制嵌入变分自由能最小化框架中,对LQG进行了推广,尽管其缺乏显式的基于Riccati方程的增益,并依赖于学习率或局部线性化等近似方法。
Linear Quadratic Gaussian (LQG) control is a framework first introduced in control theory that provides an optimal solution to linear problems of regulation in the presence of uncertainty. This framework combines Kalman-Bucy filters for the estimation of hidden states with Linear Quadratic Regulators for the control of their dynamics. Nowadays, LQG is also a common paradigm in neuroscience, where it is used to characterise different approaches to sensorimotor control based on state estimators, forward and inverse models. According to this paradigm, perception can be seen as a process of Bayesian inference and action as a process of optimal control. Recently, active inference has been introduced as a process theory derived from a variational approximation of Bayesian inference problems that describes, among others, perception and action in terms of (variational and expected) free energy minimisation. Active inference relies on a mathematical formalism similar to LQG, but offers a rather different perspective on problems of sensorimotor control in biological systems based on a process of biased perception. In this note we compare the mathematical treatments of these two frameworks for linear systems, focusing on their respective assumptions and highlighting their commonalities and technical differences.
研究动机与目标
- 阐明LQG控制与主动推理之间的关系,这两种框架虽有共同的数学根源,但在感觉运动控制中的预测结果却不同。
- 分析两种框架在连续时间线性系统中的数学表述,重点关注估计(卡尔曼-布奇滤波器)与控制(LQR)部分。
- 识别其在假设、代价泛函与实现策略方面的技术差异,特别是关于卡尔曼增益与反馈增益的使用。
- 评估主动推理是否可被视为LQG的推广,特别是在变分自由能最小化与代价到目标优化之间的对比。
- 阐明这些差异对计算神经科学中神经与认知过程建模的启示。
提出的方法
- 使用标准公式对连续时间LQG与主动推理进行形式化比较,排除如最优反馈控制等高级扩展。
- 推导并分析卡尔曼-布奇滤波器与LQR作为LQG的组成部分,依赖分离原理实现最优估计与控制。
- 在LQG中应用代价到目标泛函,定义为随时间积分的估计与控制代价,以最小化期望未来代价。
- 在主动推理中应用变分自由能最小化,其中代价泛函包含来自似然与先验分布的预测误差。
- 比较LQG中增益矩阵K(卡尔曼增益)与L(反馈增益)的作用与标准主动推理中此类增益的缺失,后者由学习率或局部线性化替代。
- 分析主动推理中缺乏Riccati方程的现象,与LQG中其核心作用形成对比,并讨论衰减记忆卡尔曼滤波器作为潜在桥梁的可能性。
实验结果
研究问题
- RQ1LQG(代价到目标)与主动推理(变分自由能)的代价泛函在结构与控制策略影响方面有何不同?
- RQ2在连续时间线性系统中,主动推理与LQG在多大程度上共享相同的数学基础?
- RQ3为何标准主动推理公式缺乏类似LQG中用于卡尔曼与反馈增益的显式Riccati型方程?
- RQ4LQG(事后方差)与主动推理(概率性、贝叶斯解释)在不确定性和估计假设方面有何差异?
- RQ5在衰减记忆假设下,主动推理能否被解释为卡尔曼滤波的特例,这对它与LQG的关系意味着什么?
主要发现
- LQG中的代价到目标泛函随时间积分未来代价,而主动推理中的变分自由能是时间无关的,表明在无限时域极限下存在固定的反馈策略。
- 尽管共享线性高斯假设,主动推理并未显式使用卡尔曼或反馈增益,而是依赖学习率或局部线性化实现在线自适应。
- 标准主动推理公式中缺乏Riccati方程,表明其与LQG的解析最优性框架存在根本性差异,尽管两者均旨在最小化不确定性和控制误差。
- 主动推理的自由能泛函包含来自联合似然与先验分布的多个预测误差,反映出LQG的最小二乘方法所不具备的贝叶斯推导。
- 衰减记忆卡尔曼滤波器可与自然梯度下降及高斯-牛顿方法关联,表明在特定假设下,主动推理可能作为扩展卡尔曼滤波的特例出现。
- 两个框架并非等价:主动推理通过将推断与控制统一于变分自由能最小化框架中,对LQG进行了推广,但代价是失去了显式、解析推导的增益矩阵。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。