Skip to main content
QUICK REVIEW

[论文解读] Sparse Uncertainty Representation in Deep Learning with Inducing Weights

Hippolyt Ritter, Martin Kukla|arXiv (Cornell University)|May 30, 2021
Gaussian Processes and Bayesian Inference参考文献 71被引用 4
一句话总结

本文提出使用诱导权重——一种低维辅助参数,将不确定性量化投影到压缩空间中——从而实现内存高效的贝叶斯神经网络与深度集成模型。通过扩展马瑟朗的条件高斯抽样规则,该方法在实现高达75.7%的参数量减少(参数量降至标准网络的≤24.3%)的同时,保持了与现有方法相当的不确定性估计性能与准确率,适用于ResNets和全连接网络。

ABSTRACT

Bayesian neural networks and deep ensembles represent two modern paradigms of uncertainty quantification in deep learning. Yet these approaches struggle to scale mainly due to memory inefficiency issues, since they require parameter storage several times higher than their deterministic counterparts. To address this, we augment the weight matrix of each layer with a small number of inducing weights, thereby projecting the uncertainty quantification into such low dimensional spaces. We further extend Matheron's conditional Gaussian sampling rule to enable fast weight sampling, which enables our inference method to maintain reasonable run-time as compared with ensembles. Importantly, our approach achieves competitive performance to the state-of-the-art in prediction and uncertainty estimation tasks with fully connected neural networks and ResNets, while reducing the parameter size to $\leq 24.3\%$ of that of a $single$ neural network.

研究动机与目标

  • 为解决贝叶斯神经网络(BNNs)与深度集成模型的高内存开销问题,这些模型相比确定性网络需要显著更多的参数。
  • 将已知具有内存效率优势的稀疏高斯过程技术,通过诱导权重扩展至有限宽度的深度神经网络。
  • 在不损失预测性能或校准性的情况下,实现高效的后验采样与不确定性量化。
  • 为全量BNN与深度集成模型提供一种参数高效的替代方案,尤其适用于资源受限设备的部署。
  • 证明不确定性可在权重空间的低维子空间中被有效表征,而不会损失预测性能或不确定性估计质量。

提出的方法

  • 引入诱导权重作为低维辅助变量,将完整权重矩阵中的不确定性投影出来,从而减少参数量。
  • 采用变分推断方法,对诱导权重使用完全分解高斯(FFG)后验分布,而非对完整权重进行推断。
  • 扩展马瑟朗规则以实现条件高斯抽样,从而支持从后部分布中快速高效地采样权重。
  • 采用一种参数化方法,通过每层的小型诱导权重矩阵,将不确定性投影至低维空间。
  • 将该框架应用于贝叶斯神经网络与深度集成模型,实现在降低内存占用的同时实现不确定性量化。
  • 使用名为 'bayesianize' 的PyTorch包装器,仅通过少量代码修改即可将确定性模型转换为贝叶斯模型。

实验结果

研究问题

  • RQ1在深度学习中,稀疏不确定性表征是否能在大幅减少参数量的同时,实现与全量贝叶斯神经网络相当的性能?
  • RQ2诱导权重是否能够实现与深度集成模型相当的高效且可扩展的后验采样?
  • RQ3在权重空间的低维子空间中,不确定性在多大程度上可以被准确表征?
  • RQ4在校准性、准确率以及分布外移位下的鲁棒性方面,该方法与标准BNN和深度集成模型相比表现如何?
  • RQ5该方法是否可有效应用于ResNets等现代网络架构,并在不降低性能的前提下实现参数效率?

主要发现

  • 所提出的诱导权重方法将参数量减少至标准确定性网络的≤24.3%,同时在图像分类任务中保持了具有竞争力的性能。
  • 在CIFAR-100上,当诱导权重使用率达到100%时,该方法实现了11.28%的测试误差,与全量BNN和深度集成模型相当。
  • 在分布外检测任务中,该方法在CIFAR-100上达到90.4%的AUC,在SVHN上达到91.2%,与基线方法持平或更优。
  • 在损坏的CIFAR-100数据集上,该方法在25%权重使用率下仍保持高准确率(如58.11%),且在100%使用率下ECE仅为4.64%,表现出强鲁棒性。
  • 通过扩展马瑟朗规则,该方法实现了快速推理,运行时间与标准集成模型相比保持合理水平。
  • 该方法在贝叶斯神经网络与深度集成模型中均表现出良好泛化能力,展示了在各类不确定性量化范式中的广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。