Skip to main content
QUICK REVIEW

[论文解读] On Batch Normalisation for Approximate Bayesian Inference

Jishnu Mukhoti, Puneet K. Dokania|arXiv (Cornell University)|Dec 24, 2020
Gaussian Processes and Bayesian Inference参考文献 18被引用 4
一句话总结

本文研究了在深度神经网络的近似贝叶斯推理背景下批归一化(BN)的作用,表明批归一化不会影响变分推理中证据下界(ELBO)的最优解。文章揭示了蒙特卡洛批归一化(MCBN)存在一个关键缺陷:随着小批量大小增加,认知不确定性会坍缩至零,导致模型无法检测分布外样本。作者提出将小批量大小视为变分参数,以在大规模数据渐近条件下恢复不确定性校准。

ABSTRACT

We study batch normalisation in the context of variational inference methods in Bayesian neural networks, such as mean-field or MC Dropout. We show that batch-normalisation does not affect the optimum of the evidence lower bound (ELBO). Furthermore, we study the Monte Carlo Batch Normalisation (MCBN) algorithm, proposed as an approximate inference technique parallel to MC Dropout, and show that for larger batch sizes, MCBN fails to capture epistemic uncertainty. Finally, we provide insights into what is required to fix this failure, namely having to view the mini-batch size as a variational parameter in MCBN. We comment on the asymptotics of the ELBO with respect to this variational parameter, showing that as dataset size increases towards infinity, the batch-size must increase towards infinity as well for MCBN to be a valid approximate inference technique.

研究动机与目标

  • 分析批归一化(BN)在贝叶斯神经网络变分推理(VI)中的作用。
  • 研究蒙特卡洛批归一化(MCBN)作为近似贝叶斯推理方法的有效性。
  • 识别MCBN在应用大尺寸小批量时的失效模式。
  • 通过将小批量大小视为MCBN中的变分参数,提出一种原则性修复方法。
  • 分析在大规模数据极限下,ELBO关于小批量大小的渐近行为。

提出的方法

  • 作者形式化了带有BN层的贝叶斯神经网络的ELBO,表明BN不会改变ELBO目标的最优解。
  • 他们将MCBN分析为一种随机近似方法,其中BN的小批量统计量提供了模型不确定性的来源。
  • 他们推导出MCBN中的随机性仅源于小批量大小,使其成为认知不确定性的关键来源。
  • 他们提出将小批量大小视为变分参数,类似于MC Dropout中对丢弃率的处理,以优化不确定性校准。
  • 他们在CIFAR-10、SVHN以及Fashion-MNIST/MNIST数据对上进行了实证评估,使用互信息作为不确定性度量。
  • 他们分析了ELBO的渐近行为,表明为使MCBN保持有效,小批量大小必须随数据集大小增长而增长。

实验结果

研究问题

  • RQ1批归一化是否会影响变分推理中证据下界(ELBO)最优解?
  • RQ2蒙特卡洛批归一化(MCBN)能否在不同小批量大小下可靠地捕捉认知不确定性?
  • RQ3为何MCBN中的认知不确定性在小批量大小增加时会退化至零?
  • RQ4在MCBN下,当数据集大小增长时,ELBO的渐近行为如何?
  • RQ5将小批量大小视为变分参数是否能恢复MCBN中的不确定性校准?

主要发现

  • 批归一化不会影响证据下界(ELBO)的最优解,意味着BN层不会改变变分推理目标的根本性质。
  • MCBN在小批量大小增加时无法保持认知不确定性,当小批量大小达到1024和2048时,预测分布与后验分布之间的互信息降至接近零。
  • 在分布外(OOD)检测任务中,使用大批次训练的MCBN模型尽管保持了高测试准确率,却失去了区分分布内与分布外样本的能力。
  • MCBN的失效归因于在大批次下BN统计量的确定性,消除了驱动不确定性估计的随机性。
  • 作者表明,为使MCBN保持有效的近似推理方法,当数据集趋向无穷大时,小批量大小必须与数据集大小成比例增长。
  • 将小批量大小视为变分参数——类似于处理MC Dropout中的丢弃率——可以恢复MCBN中的不确定性校准,表明为更鲁棒的贝叶斯深度学习提供了可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。