Skip to main content
QUICK REVIEW

[论文解读] Fast Adaptive Weight Noise

Justin Bayer, Maximilian Karl|arXiv (Cornell University)|Jul 19, 2015
Anomaly Detection Techniques and Applications参考文献 14被引用 3
一句话总结

本文提出快速自适应权重噪声(FAWN),通过利用方差传播近似边缘似然和预测分布,无需采样,在前馈神经网络中实现计算高效的变分贝叶斯推断。该方法在小样本和大样本数据集上均取得了具有竞争力的回归性能,优于先前的方法,包括高斯过程和概率性反向传播。

ABSTRACT

Marginalising out uncertain quantities within the internal representations or parameters of neural networks is of central importance for a wide range of learning techniques, such as empirical, variational or full Bayesian methods. We set out to generalise fast dropout (Wang & Manning, 2013) to cover a wider variety of noise processes in neural networks. This leads to an efficient calculation of the marginal likelihood and predictive distribution which evades sampling and the consequential increase in training time due to highly variant gradient estimates. This allows us to approximate variational Bayes for the parameters of feed-forward neural networks. Inspired by the minimum description length principle, we also propose and experimentally verify the direct optimisation of the regularised predictive distribution. The methods yield results competitive with previous neural network based approaches and Gaussian processes on a wide range of regression tasks.

研究动机与目标

  • 解决将贝叶斯神经网络应用于小样本回归任务的挑战,此类任务中传统方法如高斯过程或随机森林更受青睐。
  • 通过实现边缘似然和预测分布的确定性近似,克服深度网络中基于采样的贝叶斯推断带来的计算负担。
  • 提出一种新颖的正则化变分推断方法(FAWN-ROPD),直接基于最小描述长度原理优化预测分布。
  • 将快速丢弃推广至处理一般噪声过程和相关输出单元,提升不确定性估计的效率与准确性。

提出的方法

  • 利用方差传播计算在权重不确定性下的网络输出均值与方差,避免训练过程中进行随机采样。
  • 将快速丢弃推广至处理网络权重上的任意噪声分布(高斯分布与伯努利分布),实现参数的高效边际化。
  • 提出一种新颖的正则化目标(FAWN-ROPD),最小化负对数似然加上正则化项,灵感源自最小描述长度原理。
  • 使用对角高斯分布或伯努利分布建模权重分布,通过方差传播规则的反向传播优化参数。
  • 将该方法应用于具有ReLU激活函数的前馈神经网络,使用Adam优化器,基于128个样本的迷你批量梯度估计。
  • 通过将方差传播扩展至多输出场景,考虑输出单元间的相关性,实现联合不确定性建模的Co-FAWN。

实验结果

研究问题

  • RQ1是否可以利用方差传播在无需采样的情况下高效近似贝叶斯神经网络中的边缘似然和预测分布?
  • RQ2所提出的FAWN-ROPD方法在小样本回归任务中的预测性能,与标准变分推断及其他贝叶斯深度学习方法相比如何?
  • RQ3FAWN在伯努利丢弃之外,对其他噪声过程和相关输出单元的泛化能力如何?
  • RQ4通过最小描述长度原理直接优化正则化预测分布,是否能比标准变分推断带来更好的泛化性能?
  • RQ5在不同数据规模的多样化回归基准测试中,FAWN与高斯过程及其他最先进方法相比表现如何?

主要发现

  • 在波士顿、混凝土和游艇数据集上,FAWN-ROPD在所有方法中表现最佳,负对数似然分别为2.559 ± 0.161、3.107 ± 0.134和0.336 ± 0.271。
  • 在海军数据集上,FAWN-ROPD的负对数似然为-6.837 ± 0.131,优于所有其他方法,包括高斯过程和概率性反向传播。
  • 在Kin8nm数据集上,FAWN-ROPD的负对数似然为-1.211 ± 0.032,显著优于FAWN-VI(-1.006 ± 0.027)和PBP(-0.964 ± 0.007)。
  • 在Jura多输出回归数据集上,Co-FAWN将负对数似然从FAWN-ROPD的11.1407 ± N/A降低至8.6396 ± N/A,表明在相关输出上性能提升。
  • 在大规模Year数据集(515,345个样本)上,FAWN-ROPD的负对数似然为3.472 ± N/A,优于FAWN-VI(3.807 ± N/A),展现出对大规模数据集的可扩展性。
  • 该方法在所有测试的回归任务中均取得了具有竞争力的结果,涵盖机器人学、计算生物学和预测性维护,且无需单独的验证集或大量超参数调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。