[论文解读] Differential Bayesian Neural Nets
本文提出微分贝叶斯神经网络(DBNN),作为神经SDE的贝叶斯扩展,通过使用贝叶斯神经网络(BNN)对漂移项和扩散项进行建模,实现校准良好的不确定性量化。该方法采用改进的随机梯度朗之万动力学(SGLD)进行后验推断,在时间序列预测和UCI回归基准测试中,相较于非贝叶斯基线模型,展现出更优的不确定性校准与模型拟合性能。
Neural Ordinary Differential Equations (N-ODEs) are a powerful building block for learning systems, which extend residual networks to a continuous-time dynamical system. We propose a Bayesian version of N-ODEs that enables well-calibrated quantification of prediction uncertainty, while maintaining the expressive power of their deterministic counterpart. We assign Bayesian Neural Nets (BNNs) to both the drift and the diffusion terms of a Stochastic Differential Equation (SDE) that models the flow of the activation map in time. We infer the posterior on the BNN weights using a straightforward adaptation of Stochastic Gradient Langevin Dynamics (SGLD). We illustrate significantly improved stability on two synthetic time series prediction tasks and report better model fit on UCI regression benchmarks with our method when compared to its non-Bayesian counterpart.
研究动机与目标
- 解决神经ODE与SDE在时间序列与回归任务中缺乏良好校准的不确定性量化问题。
- 通过将漂移项与扩散项均建模为贝叶斯神经网络(BNN),将神经ODE扩展为完全的贝叶斯框架。
- 通过严谨的后验推断方法,在连续时间动力系统中实现稳健的不确定性估计。
- 在合成与真实世界回归任务中,证明所提方法在稳定性与预测性能上优于非贝叶斯及固定丢弃率基线模型。
提出的方法
- 模型使用两个独立的贝叶斯神经网络(BNN)来参数化随机微分方程(SDE)中的漂移函数与扩散函数。
- 在训练与推理过程中,通过欧拉-马鲁亚马(Euler-Maruyama)离散化方法对SDE进行数值近似求解。
- 采用改进的随机梯度朗之万动力学(SGLD)变体对BNN权重进行后验推断,实现可扩展的贝叶斯学习。
- 通过将隐藏状态的均值与协方差通过最终的线性层传播,获得预测分布,实现不确定性感知的回归。
- 通过BNN输出的Cholesky分解参数化扩散矩阵,确保正定性,并支持结构化不确定性建模。
- 该方法支持漂移与扩散组件的灵活网络架构设计,包括对角或全协方差结构。
实验结果
研究问题
- RQ1与非贝叶斯或固定丢弃率方法相比,神经SDE的完全贝叶斯形式化是否能提升时间序列预测中的不确定性校准?
- RQ2将漂移与扩散项均建模为BNN对合成与真实世界时间序列的模型稳定性与预测性能有何影响?
- RQ3与变分推断或固定正则化相比,使用SGLD对BNN权重进行后验推断在多大程度上提升了不确定性量化性能?
- RQ4与现有基于SDE的模型相比,该方法在标准UCI回归基准上是否实现了更高的测试对数似然与更好的不确定性校准?
- RQ5非贝叶斯SDE模型对超参数(如丢弃率与时间离散化)的敏感性如何?贝叶斯方法是否能缓解此问题?
主要发现
- 在全部8个UCI回归数据集上,DBNN的测试对数似然均优于或与PBP、丢弃法及N-SDE基线模型相当。
- 在boston数据集上,采用Cholesky参数化的DBNN获得测试对数似然-2.45(0.03),优于N-SDE的-2.48(0.03)。
- 在naval数据集上,采用Cholesky参数化的DBNN获得测试对数似然2.97(0.09),显著优于N-SDE的3.83(0.03)。
- 在时间序列预测中,DBNN正确捕捉了插值与外推区域的不确定性增长,而N-SDE则产生过度平滑且未校准的不确定性估计。
- 当丢弃率超过5%时,N-SDE无法收敛,凸显了非贝叶斯方法的不稳定性,而DBNN在所有实验中均保持稳定。
- 采用结构化扩散(Cholesky)显著提升了多个数据集的性能,表明建模相关噪声可增强预测不确定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。