Skip to main content
QUICK REVIEW

[论文解读] Latent Projection BNNs: Avoiding weight-space pathologies by learning latent representations of neural network weights.

Melanie F. Pradier, Weiwei Pan|arXiv (Cornell University)|Nov 16, 2018
Adversarial Robustness in Machine Learning参考文献 40被引用 10
一句话总结

本文提出潜在投影BNN(Latent Projection BNNs),这是一种变分推断框架,通过将高维神经网络权重映射到低维潜在空间,以简化不确定性量化并提升泛化能力。通过在此紧凑的潜在空间中进行推断,该方法避免了权重空间中的病态问题,在多种数据集上实现了更优的不确定性校准和性能表现。

ABSTRACT

As machine learning systems get widely adopted for high-stake decisions, quantifying uncertainty over predictions becomes crucial. While modern neural networks are making remarkable gains in terms of predictive accuracy, characterizing uncertainty over the parameters of these models is challenging because of the high dimensionality and complex correlations of the network parameter space. This paper introduces a novel variational inference framework for Bayesian neural networks that (1) encodes complex distributions in high-dimensional parameter space with representations in a low-dimensional latent space, and (2) performs inference efficiently on the low-dimensional representations. Across a large array of synthetic and real-world datasets, we show that our method improves uncertainty characterization and model generalization when compared with methods that work directly in the parameter space.

研究动机与目标

  • 为解决贝叶斯神经网络中建模复杂、高维参数分布的挑战。
  • 减少在高维权重空间中直接推断所引发的计算与统计病态问题。
  • 通过网络权重的低维潜在表征,改进不确定性表征与模型泛化能力。
  • 开发一种高效的变分推断框架,可扩展至具有复杂权重相关性的现实世界与合成数据集。

提出的方法

  • 该方法引入一个深度生成模型,将低维潜在变量映射到神经网络的高维权重空间。
  • 它使用基于神经网络的推理网络,通过潜在空间中的变分分布近似真实权重后验分布。
  • 在训练过程中优化潜在空间,以捕捉权重分布的本质结构,同时降低维度。
  • 在低维潜在空间中高效执行推断,避免高维权重空间优化带来的计算负担与不稳定性。
  • 该框架支持使用重参数化梯度的随机梯度变分推断进行端到端训练。
  • 该方法在保持预测性能的同时,通过更优地建模权重相关性,提升了不确定性校准能力。

实验结果

研究问题

  • RQ1低维潜在表征是否能有效建模贝叶斯神经网络中复杂、高维的权重分布?
  • RQ2与直接在权重空间中推断相比,在潜在空间中执行变分推断是否能减少病态问题并改善不确定性量化?
  • RQ3该方法在多样化的现实世界与合成数据集上的预测准确率和不确定性校准表现如何?
  • RQ4潜在空间在多大程度上能从高维权重相关性中解耦出有意义的结构?

主要发现

  • 与直接在权重空间中运行的基线方法相比,所提出方法在多个现实世界与合成数据集上均改善了不确定性校准效果。
  • 由于后验近似更加稳定且结构化,潜在投影BNN在低数据场景下表现出更优的泛化性能。
  • 该方法通过在低维空间中运行,减少了计算开销,同时保持了预测准确性。
  • 潜在空间捕捉到了权重分布中的有意义结构,从而实现了更高效、更精确的推断。
  • 实验结果表明,该方法在多样化基准任务中均一致提升了不确定性表征能力与模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。