Skip to main content
QUICK REVIEW

[论文解读] Sparse Deep Learning: A New Framework Immune to Local Traps and Miscalibration

Yan Sun, Wenjun Xiong|arXiv (Cornell University)|Oct 1, 2021
Statistical Methods and Inference参考文献 33被引用 5
一句话总结

本文提出了一种新颖的稀疏深度学习框架,采用先验退火算法,理论上可保证收敛至全局最优解,消除局部极小值陷阱,并实现有效的不确定性量化。该方法确保预测的渐近正态性,提供可靠的置信区间,同时在不损失准确率的前提下提升模型校准性。

ABSTRACT

Deep learning has powered recent successes of artificial intelligence (AI). However, the deep neural network, as the basic model of deep learning, has suffered from issues such as local traps and miscalibration. In this paper, we provide a new framework for sparse deep learning, which has the above issues addressed in a coherent way. In particular, we lay down a theoretical foundation for sparse deep learning and propose prior annealing algorithms for learning sparse neural networks. The former has successfully tamed the sparse deep neural network into the framework of statistical modeling, enabling prediction uncertainty correctly quantified. The latter can be asymptotically guaranteed to converge to the global optimum, enabling the validity of the down-stream statistical inference. Numerical result indicates the superiority of the proposed method compared to the existing ones.

研究动机与目标

  • 解决深度学习中过参数化网络陷入不良局部极小值或校准不足的训练-预测困境。
  • 为稀疏深度神经网络建立理论基础,支持后验一致性、变量选择与渐近正态性。
  • 通过确保预测渐近正态分布,实现可靠的不确定性量化。
  • 提出可证明收敛至全局最优的算法,克服稀疏DNN训练中的非凸性挑战。

提出的方法

  • 引入一种先验退火框架,从过参数化的DNN开始,逐步稀疏化网络结构。
  • 采用高斯混合先验,实现在保持理论可处理性的同时高效计算后验分布。
  • 设计两种退火算法——一种频率学派,一种贝叶斯方法——以避免局部极小值并确保收敛至全局最优。
  • 利用渐近正态性与后验一致性的理论结果,为预测的不确定性量化提供理论依据。
  • 将该框架应用于结构化剪枝与贝叶斯推断,支持下游统计推断并保证覆盖概率有效性。
  • 理论中采用spike-and-slab先验,实际中采用高斯混合先验,以在模型灵活性与计算可行性之间取得平衡。

实验结果

研究问题

  • RQ1能否通过具有理论收敛保证的系统性训练框架,使稀疏深度学习对局部极小值具有鲁棒性?
  • RQ2所提方法是否能确保预测的渐近正态性,从而实现有效的不确定性量化?
  • RQ3在现实数据与网络条件下,稀疏DNN能否实现后验一致性与变量选择一致性?
  • RQ4与现有剪枝与贝叶斯神经网络方法相比,先验退火方法在模型校准性与准确性方面表现如何?

主要发现

  • 所提出的先验退火算法在渐近上可保证收敛至全局最优,解决了稀疏DNN训练中的局部极小值陷阱问题。
  • 稀疏DNN的预测结果渐近服从正态分布,可通过置信区间实现对预测不确定性的正确量化。
  • 在CIFAR-10数据集上,该方法在仅运行一次的情况下即达到与BNN_BIC相当的测试准确率(ResNet-20为92.30%),而BNN_BIC需运行10次。
  • 在模型校准性指标上,该方法优于DPF:NLL更低(0.2441 vs. 0.2874),JS散度更高(6.44 vs. 7.73),ECE更低(0.0233 vs. 0.0391)(ResNet-20)。
  • 稀疏化提升了校准性——稀疏网络在ECE与JS散度上优于密集模型,表明剪枝可增强模型可靠性。
  • 理论框架建立了后验一致性与变量选择一致性,验证了稀疏DNN在统计推断中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。