Skip to main content
QUICK REVIEW

[论文解读] Variable Selection with Rigorous Uncertainty Quantification using Deep Bayesian Neural Networks: Posterior Concentration and Bernstein-von Mises Phenomenon

Jeremiah Zhe Liu|arXiv (Cornell University)|Dec 3, 2019
Fault Detection and Control Systems参考文献 50被引用 4
一句话总结

本文提出了一种用于高维变量选择的深度贝叶斯神经网络(BNN)方法,具备严格的不确定性量化能力。通过利用基于梯度的变量重要性度量的后验可信区间,该方法在实现变量效应准确学习的同时,也实现了有效的频率学覆盖(伯恩斯坦-冯米塞斯现象),在传统方法因维度灾难和多重比较而失效的高维设置下,优于现有方法。

ABSTRACT

This work develops rigorous theoretical basis for the fact that deep Bayesian neural network (BNN) is an effective tool for high-dimensional variable selection with rigorous uncertainty quantification. We develop new Bayesian non-parametric theorems to show that a properly configured deep BNN (1) learns the variable importance effectively in high dimensions, and its learning rate can sometimes "break" the curse of dimensionality. (2) BNN's uncertainty quantification for variable importance is rigorous, in the sense that its 95% credible intervals for variable importance indeed covers the truth 95% of the time (i.e., the Bernstein-von Mises (BvM) phenomenon). The theoretical results suggest a simple variable selection algorithm based on the BNN's credible intervals. Extensive simulation confirms the theoretical findings and shows that the proposed algorithm outperforms existing classic and neural-network-based variable selection methods, particularly in high dimensions.

研究动机与目标

  • 解决高维变量选择中维度灾难和多重比较的双重挑战。
  • 为深度BNN在高维环境中准确学习变量重要性的理论基础提供支持。
  • 验证BNN通过可信区间实现校准的不确定性量化,且可信区间能实现正确的频率学覆盖。
  • 基于梯度重要性度量的后验可信区间,开发一种实用的变量选择算法。
  • 展示所提方法在高维非线性回归场景下,相较于经典方法和基于神经网络的变量选择技术,具有更优的性能。

提出的方法

  • 使用平方积分梯度范数 $\psi_p(f) = \|\partial_{x_p}f\|_n^2$ 作为每个输入特征的变量重要性度量。
  • 对深度神经网络应用贝叶斯推断,获得所有 $\psi_p(f)$ 的联合后验分布,从而实现对不确定性的同步量化。
  • 采用MCMC采样计算所有特征的 $(1-\alpha)$-水平联合可信区间。
  • 提出一种变量选择规则:若某变量的可信区间不包含零,则将其纳入模型。
  • 建立新的贝叶斯非参数定理,用于分析 $\psi_p(f)$ 的后验集中性和渐近正态性。
  • 推导出 $\psi_p(f)$ 的后验分布收敛到正态分布的条件,从而确保可信区间的有效性。

实验结果

研究问题

  • RQ1深度BNN能否以与学习真实回归函数 $f_0$ 相当或更快的速率学习变量重要性 $\psi_p(f)$?
  • RQ2是否后验分布 $\psi_p(f)$ 满足伯恩斯坦-冯米塞斯(BvM)现象,即 $95\%$ 可信区间以 $95\%$ 的频率覆盖真实值 $\psi_p(f_0)$?
  • RQ3在高维设置下,BNN-based 变量选择方法能否在多重比较中保持有效的第一类错误控制?
  • RQ4在何种条件下,BNN 对变量重要性的学习速率能够‘打破’维度灾难,即避免对输入维度 $P$ 的指数依赖?
  • RQ5在高维、非线性回归场景下,BNN-based 方法相较于 LASSO、Knockoffs 及其他基于神经网络的变量选择技术,性能如何?

主要发现

  • 深度BNN学习变量重要性 $\psi_p(f)$ 的速率至少与学习真实回归函数 $f_0$ 的速率相当,如定理1所形式化。
  • 在某些情形下,变量重要性学习速率不表现出对维度 $P$ 的指数依赖,从而有效‘打破’维度灾难,如命题1所示。
  • 后验分布 $\psi_p(f)$ 满足伯恩斯坦-冯米塞斯现象,即 $95\%$ 可信区间以 $95\%$ 的频率覆盖真实 $\psi_p(f_0)$,如定理2和定理3所证明。
  • 基于可信区间的所提方法优于现有方法,包括 LASSO、Knockoffs 及其他基于神经网络的方法,尤其在高维、非线性场景下表现更优。
  • 模拟结果表明,BNN 学习变量重要性 $\psi_p(f)$ 的速度显著快于其学习 $f^*$ 预测的速度,表明其在重要性估计方面具有极高的效率。
  • 该方法在无需稀疏诱导正则化的情况下实现了严格的不确定性量化,表明当模型设定正确时,基于模型的可信区间具有强大优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。