Skip to main content
QUICK REVIEW

[论文解读] What can linearized neural networks actually say about generalization?

Guillermo Ortiz-Jiménez, Seyed-Mohsen Moosavi-Dezfooli|arXiv (Cornell University)|Jun 12, 2021
Neural Networks and Applications参考文献 44被引用 14
一句话总结

本文通过在不同任务上对比神经网络与其线性化对应物,研究了神经正切核(NTK)近似在深度学习泛化中的实际有效性。研究发现,尽管NTK对齐能够预测学习复杂度,但非线性动力学会导致网络表现不如其线性近似——这是由于核旋转引发过拟合所致,挑战了非线性模型始终优于核的假设。

ABSTRACT

For certain infinitely-wide neural networks, the neural tangent kernel (NTK) theory fully characterizes generalization, but for the networks used in practice, the empirical NTK only provides a rough first-order approximation. Still, a growing body of work keeps leveraging this approximation to successfully analyze important deep learning phenomena and design algorithms for new applications. In our work, we provide strong empirical evidence to determine the practical validity of such approximation by conducting a systematic comparison of the behavior of different neural networks and their linear approximations on different tasks. We show that the linear approximations can indeed rank the learning complexity of certain tasks for neural networks, even when they achieve very different performances. However, in contrast to what was previously reported, we discover that neural networks do not always perform better than their kernel approximations, and reveal that the performance gap heavily depends on architecture, dataset size and training task. We discover that networks overfit to these tasks mostly due to the evolution of their kernel during training, thus, revealing a new type of implicit bias.

研究动机与目标

  • 评估NTK近似在预测真实世界神经网络泛化性能方面的实际有效性。
  • 探究尽管具备非线性能力,神经网络为何有时会表现不如其线性近似。
  • 明确训练过程中核演化在塑造泛化行为中的作用。
  • 确定初始化时的NTK对齐是否能对不同任务的学习复杂度进行排序。
  • 揭示由非线性动力学引入的归纳偏置,特别是核旋转的作用。

提出的方法

  • 在具有相同数据但不同标签函数的多个任务上,系统比较深度神经网络与其线性化近似(通过一阶泰勒展开)的性能。
  • 测量初始化时目标函数与经验NTK之间的对齐程度,以预测学习复杂度。
  • 通过特征函数分解追踪训练过程中NTK的演化,分析其旋转动力学。
  • 在不同训练阶段(例如,0、100轮)提取核矩阵,并在相同任务上评估线性化模型,以评估性能衰减或提升。
  • 使用受控任务(如学习特征的符号函数,例如 $\operatorname{sign}(\phi_{400}(\mathbf{x}))$)来隔离泛化行为。
  • 分析核旋转的主要方向,并将其与过拟合和测试准确率相关联。

实验结果

研究问题

  • RQ1初始化时的NTK对齐能否预测不同任务下深度网络的相对学习复杂度?
  • RQ2在何种条件下,尽管具备非线性能力,神经网络仍会表现不如其线性近似?
  • RQ3训练过程中经验NTK的演化如何影响泛化与过拟合?
  • RQ4核旋转在深度网络的非线性优势或劣势中扮演何种角色?
  • RQ5网络与其线性近似之间的性能差距是否由架构、数据集大小或任务结构决定?

主要发现

  • 初始化时目标函数与经验NTK之间的对齐程度,可在多样化任务中可靠预测相对学习复杂度。
  • 在某些任务上,神经网络可能表现不如其线性近似,尤其是在训练任务与网络归纳偏置不匹配时。
  • 当在非线性预训练后从不匹配任务中提取核时,线性化模型的性能迅速下降,表明非线性动力学会损害泛化能力。
  • 训练过程中,经验NTK主要沿单一主轴旋转,该旋转与过拟合及测试准确率下降密切相关。
  • 核旋转机制解释了为何网络可能快速收敛到训练标签但泛化能力差,具体取决于目标函数的结构。
  • 本研究揭示了一种新型归纳偏置:NTK在训练过程中倾向于沿单一方向旋转,该特性可能增强或损害泛化能力,具体取决于任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。