Skip to main content
QUICK REVIEW

[论文解读] A self consistent theory of Gaussian Processes captures feature learning effects in finite CNNs

Gadi Naveh, Zohar Ringel|arXiv (Cornell University)|Jun 8, 2021
Gaussian Processes and Bayesian Inference被引用 6
一句话总结

该论文提出了一套自洽的高斯过程(GP)理论,通过在网络初始化时引入高阶累积量导出的非线性目标偏移,捕捉了有限卷积神经网络(CNN)中的特征学习。该框架揭示了特征学习与懒惰学习模式之间的显著相变,即使在远离无限宽度极限的情况下,其预测与实验结果高度一致,为有限深度神经网络(DNN)效应提供了一种非微扰的解析工具,超越了标准GP近似。

ABSTRACT

Deep neural networks (DNNs) in the infinite width/channel limit have received much attention recently, as they provide a clear analytical window to deep learning via mappings to Gaussian Processes (GPs). Despite its theoretical appeal, this viewpoint lacks a crucial ingredient of deep learning in finite DNNs, laying at the heart of their success -- feature learning. Here we consider DNNs trained with noisy gradient descent on a large training set and derive a self consistent Gaussian Process theory accounting for strong finite-DNN and feature learning effects. Applying this to a toy model of a two-layer linear convolutional neural network (CNN) shows good agreement with experiments. We further identify, both analytical and numerically, a sharp transition between a feature learning regime and a lazy learning regime in this model. Strong finite-DNN effects are also derived for a non-linear two-layer fully connected network. Our self consistent theory provides a rich and versatile analytical framework for studying feature learning and other non-lazy effects in finite DNNs.

研究动机与目标

  • 为解决高斯过程(GP)近似在捕捉有限深度神经网络(DNN)中特征学习方面的局限性,而这些特征学习对现实世界DNN的成功至关重要。
  • 开发一种非微扰的解析框架,以考虑强有限-DNN效应(包括非懒惰训练动力学),超越标准无限宽度GP和NTK极限。
  • 通过分析与数值方法,识别并表征有限DNN中特征学习与懒惰学习模式之间的相变。
  • 将GP框架扩展以包含非线性和有限宽度修正,从而在一般化和预测性能上优于标准GP先验。
  • 为研究有限DNN中权重动力学与隐藏层统计特性(特别是卷积架构)提供统一的解析工具。

提出的方法

  • 为使用噪声梯度下降训练的有限DNN推导出自洽的GP理论,引入一个考虑初始化时网络输出高阶累积量的修正目标函数,以捕捉有限宽度修正。
  • 引入一个涉及DNN输出在初始化时的二阶与三阶累积量的非线性自洽方程,以预测目标偏移,从而实现对特征学习效应的精确建模。
  • 在教师-学生设置下将该框架应用于两层线性CNN,推导出与实验结果高度一致的解析预测,即使在强有限-DNN区域也成立。
  • 利用该框架研究隐藏层权重的后验协方差,基于谱特征识别出特征学习与懒惰学习阶段之间的显著相变。
  • 将该方法扩展至非线性两层全连接网络,证明由于有限-DNN修正,其性能显著优于标准GP近似。
  • 采用渐近分析与大-N标度,推导出关键参数(α, β)的衰减速率,表明当 n ~ Md 时可提供足够约束以确保DNN参数接近教师参数,从而验证了良好泛化的标度规律。

实验结果

研究问题

  • RQ1如何将高斯过程框架扩展以捕捉有限DNN中的特征学习效应,而这些效应在标准无限宽度GP近似中并不存在?
  • RQ2高阶累积量(如三阶累积量)在使用噪声梯度下降训练的有限DNN中,对有效目标偏移起何作用?
  • RQ3有限CNN中是否存在特征学习与懒惰学习模式之间的显著相变?该相变能否被解析表征?
  • RQ4与标准GP先验相比,有限-DNN修正在多大程度上提升了泛化性能,尤其是在先验未捕捉到数据中存在约束(如正定性、权重重用)的情况下?
  • RQ5隐藏层权重的统计特性——特别是其后验协方差谱——在多大程度上反映了有限DNN中是否存在特征学习?

主要发现

  • 所提出的自洽GP理论能准确预测使用噪声梯度下降训练的有限DNN的平均预测器,且在远离无限宽度极限时仍与实验结果高度一致。
  • 该理论在两层线性CNN中识别出特征学习与懒惰学习模式之间的显著相变,其行为类似于在噪声Wishart矩阵中进行低秩信号恢复。
  • 特征学习阶段由学生隐藏层权重后验协方差中清晰的谱特征定义,该特征仅在教师特征足够强时才出现。
  • 有限-DNN修正显著提升了性能,尤其在数据施加约束(如正定性、权重重用)而先验未捕捉到这些约束时。
  • 渐近分析表明,参数 α 和 β 的衰减速率为 O(σ²/(λ₀n)),当 n ~ Md 时可提供足够数据以约束DNN参数接近教师参数,从而验证了良好泛化的标度规律。
  • 该框架提供了一种非微扰、可解析处理的方法,用于研究有限DNN中的非懒惰效应(包括权重动力学与泛化),其适用范围不仅限于线性模型,还可推广至非线性架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。