Skip to main content
QUICK REVIEW

[论文解读] Gaussian Process Surrogate Models for Neural Networks

Michael Y. Li, Erin Grant|arXiv (Cornell University)|Aug 11, 2022
Gaussian Processes and Bayesian Inference被引用 4
一句话总结

本文提出一种数据驱动方法,通过从经验预测中学习核函数,而非从无限宽极限中解析推导,构建有限宽度神经网络的高斯过程(GP)代理模型。该方法捕捉了谱偏差等关键现象,并实现了实际应用,如识别影响训练样本和预测泛化性能,表明学习到的GP可作为神经网络行为的可解释、可预测代理模型。

ABSTRACT

Not being able to understand and predict the behavior of deep learning systems makes it hard to decide what architecture and algorithm to use for a given problem. In science and engineering, modeling is a methodology used to understand complex systems whose internal processes are opaque. Modeling replaces a complex system with a simpler, more interpretable surrogate. Drawing inspiration from this, we construct a class of surrogate models for neural networks using Gaussian processes. Rather than deriving kernels for infinite neural networks, we learn kernels empirically from the naturalistic behavior of finite neural networks. We demonstrate our approach captures existing phenomena related to the spectral bias of neural networks, and then show that our surrogate models can be used to solve practical problems such as identifying which points most influence the behavior of specific neural networks and predicting which architectures and algorithms will generalize well for specific datasets.

研究动机与目标

  • 为解决深度学习系统在实际应用中可解释性与可预测性不足的问题。
  • 开发一种建模框架,将神经网络视为黑箱,并用更简单、可解释的代理模型替代之。
  • 通过经验数据学习有限宽度神经网络预测中的核函数,而非依赖理论极限或解析推导。
  • 实现实际应用,如识别影响最大的训练样本,以及在不同架构和数据集上预测泛化性能。
  • 证明GP代理模型能够捕捉已知现象(如谱偏差),并提供统一、可解释的框架以理解神经网络行为。

提出的方法

  • 通过优化由有限宽度神经网络集成预测得到的GP边际对数似然(mLL),学习GP代理模型的核超参数。
  • 使用包含Q=10个混合分量的谱混合核(SMK)来建模GP协方差函数,以灵活表示神经网络预测中的复杂模式。
  • 通过随机初始化的50个全连接网络(ReLU或正弦激活函数,深度为16或32层)的预测结果,使用Adam优化器进行小批量梯度下降训练GP代理模型。
  • 通过在三次随机初始化中选择mLL最高的配置来推断核超参数,以确保结果稳健性。
  • 利用GP的解析性质(如闭式边际似然和留一法预测分布)降低影响分析与泛化差距分析的计算成本。
  • 通过可视化样本并评估其对周期性与深度相关行为等结构性质的反映能力,比较学习到的GP先验与神经网络先验。

实验结果

研究问题

  • RQ1数据驱动的GP代理模型能否捕捉神经网络中的已知现象(如谱偏差)?
  • RQ2GP代理模型在多大程度上能准确建模不同神经网络族(如ReLU与正弦网络)的先验与归纳偏差?
  • RQ3GP代理模型能否识别出对特定神经网络行为影响最大的训练样本?
  • RQ4GP代理模型能否预测在给定数据集上,哪些神经网络架构与优化算法将具有良好的泛化性能?
  • RQ5GP代理模型在捕捉真实世界神经网络行为方面,与理论上的无限宽极限相比表现如何?

主要发现

  • 学习到的GP代理模型成功捕捉了神经网络的谱偏差,显示核函数中谱频率范围随训练迭代次数增加,与先前研究结果一致。
  • GP代理模型反映了架构差异:32层网络表现出更快变化的行为与更短的长度尺度,而ReLU网络在尖点附近呈现先增后减的模式。
  • 代理模型准确刻画了不同神经网络族的先验行为,包括正弦网络中的周期性以及激活模式的深度依赖性变化。
  • 该方法通过留一法预测分布高效识别出影响最大的训练样本,减少了对昂贵重训练的需求。
  • 通过分析学习到的GP核结构与超参数,该框架能够跨架构与数据集预测泛化性能。
  • 数据驱动方法在捕捉实际有限网络行为方面优于理论上的无限宽推导,尤其在捕捉非渐近现象(如病态初始化效应)方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。