[论文解读] Hierarchical Gaussian Process Priors for Bayesian Neural Network Weights
该论文提出了一种基于单元级潜在变量的层次化高斯过程先验,用于贝叶斯神经网络权重,以建模相关的权重结构,通过核函数实现灵活的归纳偏置和输入相关先验。该方法在分布外数据上的不确定性量化表现优异,在主动学习中也表现出色,优于包括DKL和MAP估计在内的强基线模型。
Probabilistic neural networks are typically modeled with independent weight priors, which do not capture weight correlations in the prior and do not provide a parsimonious interface to express properties in function space. A desirable class of priors would represent weights compactly, capture correlations between weights, facilitate calibrated reasoning about uncertainty, and allow inclusion of prior knowledge about the function space such as periodicity or dependence on contexts such as inputs. To this end, this paper introduces two innovations: (i) a Gaussian process-based hierarchical model for network weights based on unit embeddings that can flexibly encode correlated weight structures, and (ii) input-dependent versions of these weight priors that can provide convenient ways to regularize the function space through the use of kernels defined on contextual inputs. We show these models provide desirable test-time uncertainty estimates on out-of-distribution data, demonstrate cases of modeling inductive biases for neural networks with kernels which help both interpolation and extrapolation from training data, and demonstrate competitive predictive performance on an active learning benchmark.
研究动机与目标
- 为解决贝叶斯神经网络中独立权重先验的局限性,后者无法捕捉权重相关性,且缺乏表达函数归纳偏置的紧凑接口。
- 开发一种结构化、参数高效的权重先验,以实现校准的不确定性估计,并整合如周期性或输入上下文等先验知识。
- 通过基于核函数的构造实现输入相关权重先验,以正则化函数空间行为,同时保持权重结构。
- 设计一种高效的变分推理方案,避免在高维权重空间中直接推断,同时保持权重相关性。
- 与强基线相比,展示在插值、外推、不确定性估计和主动学习方面的性能提升。
提出的方法
- 提出一种基于单元级潜在变量 $\mathbf{z}_{l,i}$ 的神经网络权重层次化先验,其中每个权重 $w_{l,i,j}$ 通过从连接的潜在码 $[\mathbf{z}_{l,i}, \mathbf{z}_{l+1,j}]$ 映射得到的函数 $f$ 生成。
- 采用元网络(超网络)$\mathrm{NN}_\theta$ 将潜在码映射为权重均值,使用高斯噪声模型 $p(\mathbf{w}|\mathbf{C}_w(\mathbf{z}), \theta) = \mathcal{N}(\mathbf{w}|\mathrm{NN}_\theta(\mathbf{C}_w(\mathbf{z})))$。
- 在单元潜在变量 $\mathbf{z}$ 上引入全局GP先验,其中 $p(\mathbf{z}) = \prod \mathcal{N}(\mathbf{z}_{l,i}; \mathbf{0}, \mathbf{I})$,以实现跨权重的结构化相关性建模。
- 通过在上下文输入上定义局部核 $k_{\text{local}}$,将模型扩展为输入相关先验,使每个数据点具有独立的先验,从而编码函数归纳偏置。
- 使用结构化变分推理近似潜在变量 $\mathbf{z}$ 的后验,避免在高维权重空间中直接推断,同时保持权重相关性。
- 采用组合核构造,结合全局核与局部核,灵活建模输入相关权重先验和函数特性。
实验结果
研究问题
- RQ1基于单元级潜在变量的层次化GP先验能否有效建模贝叶斯神经网络中的相关权重结构?
- RQ2通过在上下文输入上构建核函数生成的输入相关权重先验,能否提升函数空间中的泛化能力和不确定性校准?
- RQ3所提出的结构化变分推理策略是否能保持权重相关性,并在预测性能和不确定性估计方面优于均场近似?
- RQ4通过利用信息丰富、结构化的先验和不确定性感知的选择标准,该模型能否实现更优的主动学习性能?
- RQ5在分布外数据的不确定性量化方面,该模型与DKL和MAP等强基线相比表现如何?
主要发现
- 所提出的MetaGP模型在分布外数据上的不确定性估计显著优于所有比较模型,包括DKL和MAP,后者常产生过度自信的预测。
- 在Kuzushiji-MNIST数据集上,模型展现出更优的不确定性校准,其预测熵能清晰区分分布外样本与分布内样本。
- 在UCI回归数据集的主动学习中,MetaGP模型以更少的查询次数实现了与均场变分推理相当或更优的预测性能,表明其不确定性驱动采样有效。
- 该模型优于MAP估计,后者即使在分布内测试集上表现良好,但在分布外数据上始终产生较差的不确定性估计。
- 结构化变分推理方法成功保持了权重相关性,并实现了高效的训练,无需在高维权重空间中直接进行后验推断。
- 使用组合核函数实现输入相关先验,使模型能够编码如周期性或上下文依赖等函数归纳偏置,从而提升插值与外推性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。