[论文解读] Stationary Activations for Uncertainty Calibration in Deep Learning
本文提出了马特ernn激活函数——一种源自高斯过程中马特ernn核族的非线性神经网络激活函数。通过将这些激活函数与无限宽度网络中的GP先验相联系,该方法在分布外(OOD)输入上实现了改进的不确定性校准,其中马特ernn-5/2在OOD不确定性分离方面优于标准ReLU和RBF激活函数。
We introduce a new family of non-linear neural network activation functions that mimic the properties induced by the widely-used Matérn family of kernels in Gaussian process (GP) models. This class spans a range of locally stationary models of various degrees of mean-square differentiability. We show an explicit link to the corresponding GP models in the case that the network consists of one infinitely wide hidden layer. In the limit of infinite smoothness the Matérn family results in the RBF kernel, and in this case we recover RBF activations. Matérn activation functions result in similar appealing properties to their counterparts in GP models, and we demonstrate that the local stationarity property together with limited mean-square differentiability shows both good performance and uncertainty calibration in Bayesian deep learning tasks. In particular, local stationarity helps calibrate out-of-distribution (OOD) uncertainty. We demonstrate these properties on classification and regression benchmarks and a radar emitter classification task.
研究动机与目标
- 解决深度神经网络中不确定性校准不足的问题,特别是针对分布外(OOD)输入。
- 通过结构化激活函数嵌入先验知识,提升贝叶斯深度学习模型的可解释性和可靠性。
- 通过从马特ernn核族推导新型激活函数,弥合高斯过程先验与神经网络激活函数之间的鸿沟。
- 证明激活函数中的局部平稳性和有限二阶均值可微性可带来更优的OOD不确定性估计。
- 通过基于理解良好的GP核性质,为标准ReLU和RBF激活函数提供有原则的替代方案。
提出的方法
- 通过反转无限宽度神经网络中使用的核-激活映射,推导出一类新的非线性激活函数。
- 将马特ernn核的参数(平滑度ν和长度尺度ℓ)直接映射到激活函数参数,确保与GP先验的一致性。
- 建立单层、无限宽神经网络使用马特ernn激活函数与马特ernn处理的GP之间的显式等价关系。
- 使用蒙特卡洛Dropout进行近似贝叶斯推断,实现在无需复杂变分推断的情况下进行不确定性量化。
- 训练标准前馈网络,使用马特ernn-ν/2激活函数(ν = 1.5, 2.5, 4.5),并与ReLU、RBF、ERF和阶跃激活函数在性能和不确定性校准方面进行比较。
- 通过预测方差直方图以及对已知类和未知类中高/低方差测试样本的可视化检查,评估不确定性。
实验结果
研究问题
- RQ1能否通过源自知名GP核的马特ernn激活函数,改善深度神经网络中的不确定性校准?
- RQ2与标准ReLU或RBF激活函数相比,马特ernn激活函数中的局部平稳性如何影响分布外(OOD)不确定性估计?
- RQ3激活函数中有限的二阶均值可微性是否能带来更好的泛化能力和不确定性量化?
- RQ4马特ernn族中平滑度参数ν的选择如何影响不确定性校准以及模型在OOD检测任务上的性能?
- RQ5所提出的激活函数能否在已知类与未知类不确定性分离方面优于现有激活函数?
主要发现
- 在CIFAR-10 OOD基准上,马特ernn-5/2激活函数在已知类别中高不确定性与未知类别中低不确定性之间表现出显著更好的分离效果。
- 马特ernn-3/2激活函数产生更直观的不确定性模式:在已知类别输入上呈现高不确定性,而在未知类别输入上呈现低不确定性。
- 指数型(马特ernn-1/2)激活函数导致OOD不确定性分离效果差,无论在已知类还是未知类中均表现出持续的高方差。
- ReLU和阶跃激活函数产生任意的不确定性模式,即使在正确分类的未知样本上也表现出高方差,表明校准性差。
- ERF和RBF激活函数表现出中等水平的OOD不确定性分离,但在直观性和一致性方面仍逊于马特ernn-5/2和马特ernn-3/2。
- 马特ernn-5/2激活函数在性能与不确定性校准之间实现了最佳平衡,对已知类别表现出高置信度,对未知类别表现出高不确定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。