[论文解读] A Gaussian Process perspective on Convolutional Neural Networks
本文通过将中心极限定理推广至卷积层中的非独立同分布(non-i.i.d.)输入,建立了卷积神经网络(CNNs)的高斯过程(GP)视角,表明即使在输入存在依赖性或非同分布的情况下,CNN 输出仍会收敛至 GP 先验。实验结果证实 CNN 的行为类似于 GP,尤其在使用有界激活函数(如 tanh)时,可通过 GP 推断实现解析的不确定性量化。
In this paper we cast the well-known convolutional neural network in a Gaussian process perspective. In this way we hope to gain additional insights into the performance of convolutional networks, in particular understand under what circumstances they tend to perform well and what assumptions are implicitly made in the network. While for fully-connected networks the properties of convergence to Gaussian processes have been studied extensively, little is known about situations in which the output from a convolutional network approaches a multivariate normal distribution.
研究动机与目标
- 通过高斯过程(GPs)的视角来扩展对卷积神经网络(CNNs)的理论理解,特别是探讨其收敛至 GP 先验的机制。
- 解决与全连接网络相比,CNN 中 GP 收敛性缺乏理论分析的问题,后者中的收敛性已有充分研究。
- 研究在输入存在依赖性或非同分布时,CNN 输出近似多变量正态分布的条件。
- 通过数值方法评估 CNN 与 GP 先验之间的差异,分析激活函数和网络深度对这种收敛性的影响。
- 探讨 GP 类行为对 CNN 后验不确定性估计的影响,实现无需 MCMC 或集成方法的解析推断。
提出的方法
- 应用广义中心极限定理(Lyapunov 类型界)处理卷积层中非独立同分布的加权和,将 GP 收敛框架扩展至非 i.i.d. 输入。
- 推导 CNN 输出的递归核表达式,其结构与 GP 协方差函数一致,从而可与 GP 先验直接比较。
- 使用最大均值差异(MMD)数值量化不同激活函数和输入类型下 CNN 输出分布与对应 GP 先验之间的距离。
- 在 i.i.d. 输入和自回归时间序列输入上测试 GP 近似,评估在真实数据依赖性下的鲁棒性。
- 在数据集上训练后,将 CNN 后验均值和方差与对应 GP 的后验进行比较,使用集成推断(N=100)来近似后验不确定性。
- 采用线性、ReLU 和双曲正切激活函数,评估其对 GP 收敛性和后验一致性的影。
实验结果
研究问题
- RQ1在输入非 i.i.d. 的情况下,卷积神经网络的输出在何种条件下会收敛至高斯过程先验?
- RQ2激活函数的选择(如 ReLU 与 tanh)如何影响 CNN 输出与 GP 先验之间的差异?
- RQ3输入依赖性(如自回归结构)在多大程度上影响 CNN 的 GP 近似效果?
- RQ4是否可以利用 CNN 的 GP 先验进行解析的不确定性估计?CNN 后验与 GP 后验的匹配程度如何?
- RQ5CNN 输出收敛至 GP 的速率如何?对于深层网络中的依赖变量,该收敛性能否被严格证明?
主要发现
- 即使在非 i.i.d. 输入下,CNN 输出分布仍会趋近于高斯过程先验,通过第一层的 Lyapunov 类型界得到验证,将 GP 收敛性从 i.i.d. 设置扩展至更广泛场景。
- 对于 ReLU 激活函数,CNN 与 GP 先验之间的差异随网络深度显著增加,尤其在 i.i.d. 输入下,表明其偏离 GP 行为。
- 对于有界激活函数(如双曲正切),差异在多层网络中保持较小,表明在非线性有界变换下表现出更强的 GP 类似行为。
- 当输入服从 AR(2) 过程时,无界激活函数(线性和 ReLU)的 CNN-GP 差异显著高于有界激活函数(tanh),这是由于加权和中依赖性增强所致。
- 通过 100 次随机初始化训练的 CNN,其后验均值和方差估计与对应 GP 后验高度一致,表明基于 GP 的不确定性量化在 CNN 中具有可行性。
- 实证结果表明,具有有界激活函数、中等滤波器大小(2–8)和深度(2–5 层)的 CNN 展现出 GP 类似行为,支持在 CNN 中使用 GP 进行解析不确定性估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。