Skip to main content
QUICK REVIEW

[论文解读] Building Bayesian Neural Networks with Blocks: On Structure, Interpretability and Uncertainty

Hao Zhou, Yunyang Xiong|arXiv (Cornell University)|Jun 10, 2018
Anomaly Detection Techniques and Applications参考文献 12被引用 3
一句话总结

本文提出了一种基于模块的贝叶斯神经网络(BNN)构建框架,通过将模型结构化为加法或层次化组件,提升了可解释性与不确定性估计。该方法利用计算骨架和双重随机变分推断,实现了高效的后验近似,其中专门设计的贝叶斯加法神经网络(AddNN)在基准数据集上表现出更优的性能与稀疏性,有效捕捉了特征交互关系。

ABSTRACT

We provide simple schemes to build Bayesian Neural Networks (BNNs), block by block, inspired by a recent idea of computation skeletons. We show how by adjusting the types of blocks that are used within the computation skeleton, we can identify interesting relationships with Deep Gaussian Processes (DGPs), deep kernel learning (DKL), random features type approximation and other topics. We give strategies to approximate the posterior via doubly stochastic variational inference for such models which yield uncertainty estimates. We give a detailed theoretical analysis and point out extensions that may be of independent interest. As a special case, we instantiate our procedure to define a Bayesian {\em additive} Neural network -- a promising strategy to identify statistical interactions and has direct benefits for obtaining interpretable models.

研究动机与目标

  • 开发一种模块化、可解释的贝叶斯神经网络(BNN)构建框架,通过结构化模块的组合实现。
  • 利用双重随机变分推断实现BNN中高效的后验近似,支持小批量训练与可扩展性。
  • 在BNN、深度高斯过程(DGPs)、深度核学习与随机特征之间建立理论与实践上的联系。
  • 设计一种贝叶斯加法神经网络(AddNN),显式建模稀疏加法交互关系,以提升可解释性。
  • 在基准数据集上评估该方法,展示其具有竞争力的预测性能与不确定性量化能力。

提出的方法

  • 该框架使用计算骨架抽象,将BNN由可重用模块组合而成,支持模型结构的模块化设计。
  • 每个模块对应一个概率组件(如子网络),并在权重上设置先验以支持贝叶斯推断。
  • 采用双重随机变分推断近似后验分布,支持小批量训练与反向传播。
  • AddNN变体将最终输出构建为多个小型、独立子网络的和,促进加法结构与稀疏性。
  • 对每个子网络的第一层应用组Lasso正则化,以鼓励稀疏且可解释的输入特征选择。
  • 通过后验抽样实现不确定性估计,并提供经验的$β$-范数交互度量,用于检测特征交互。

实验结果

研究问题

  • RQ1基于模块的BNN构建方法是否能在保持不确定性量化能力的同时,提升可解释性?
  • RQ2不同类型的模块与现有模型(如深度高斯过程DGPs与深度核学习)之间有何关联?
  • RQ3贝叶斯加法神经网络结构是否能有效学习高维数据中的稀疏、可解释交互关系?
  • RQ4所提出的双重随机变分推断方案是否能高效扩展至大规模数据集,同时保持模型准确性?
  • RQ5从模型中推导出的交互度量如何帮助识别有意义的特征依赖关系?

主要发现

  • 贝叶斯加法神经网络(AddNN)在基准回归任务中达到最先进或具有竞争力的性能,波士顿数据集RMSE为3.03±0.12,Kin8nm数据集为0.06±0.00,Power数据集为3.68±0.03。
  • AddNN在多个数据集上优于MC正则化与PBP,包括Energy(0.65±0.03 vs. 1.66±0.04)与Protein(4.07±0.01 vs. 4.36±0.01)。
  • 模型学习到稀疏加法结构,通过输入到子网络的权重矩阵可视化可见,特征选择具有选择性与非均匀性。
  • 计算效率方面,AddNN的复杂度为$k^{*}d^{2L-1}$,相较于具有相同深度与宽度的标准DNN,计算量减少${k^{*}}^{2(L-1)}$倍。
  • 使用$\mathbb{E}^n$作为交互度量的基线,相比$\delta(\mathbf{x}^0)$,能实现更优的经验比较与特征交互检测。
  • 该框架成功在理论基础上将BNN与DGPs、深度核学习及随机特征统一于同一基于模块的结构之下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。