Skip to main content
QUICK REVIEW

[论文解读] Limitations of the NTK for Understanding Generalization in Deep Learning

Nikhil Vyas, Yamini Bansal|arXiv (Cornell University)|Jun 20, 2022
Neural Networks and Applications被引用 4
一句话总结

本文表明,神经正切核(NTK)无法捕捉深度学习泛化的关键方面,尤其是数据缩放定律。尽管NTK是无限宽网络的理论基础代理,但在CIFAR-10和SVHN等真实数据集上,其经验NTK与无限NTK的泛化性能均劣于有限宽度神经网络,即使在部分预训练后依然如此。研究发现,NTK在整个训练过程中持续改进,与早期稳定化的说法相矛盾,因此无法完全解释真实神经网络的样本效率。

ABSTRACT

The ``Neural Tangent Kernel'' (NTK) (Jacot et al 2018), and its empirical variants have been proposed as a proxy to capture certain behaviors of real neural networks. In this work, we study NTKs through the lens of scaling laws, and demonstrate that they fall short of explaining important aspects of neural network generalization. In particular, we demonstrate realistic settings where finite-width neural networks have significantly better data scaling exponents as compared to their corresponding empirical and infinite NTKs at initialization. This reveals a more fundamental difference between the real networks and NTKs, beyond just a few percentage points of test accuracy. Further, we show that even if the empirical NTK is allowed to be pre-trained on a constant number of samples, the kernel scaling does not catch up to the neural network scaling. Finally, we show that the empirical NTK continues to evolve throughout most of the training, in contrast with prior work which suggests that it stabilizes after a few epochs of training. Altogether, our work establishes concrete limitations of the NTK approach in understanding generalization of real networks on natural datasets.

研究动机与目标

  • 探究神经正切核(NTK)是否能准确捕捉真实、有限宽度神经网络的泛化行为。
  • 评估NTK(包括无限和经验形式)在在真实神经网络训练中观察到的数据和时间缩放定律方面的解释能力。
  • 挑战NTK在训练早期即稳定并可作为表征学习可靠代理的假设。
  • 识别NTK框架在建模现代深度学习模型的样本效率和泛化性能方面的根本局限。

提出的方法

  • 作者在CIFAR-10和SVHN等真实数据集上,比较了有限宽度神经网络、其对应的无限NTK以及在不同训练阶段提取的经验NTK(初始化时及训练后)的数据缩放行为。
  • 他们使用对数-对数缩放图分析模型性能随训练数据量和训练时间的变化,通过测量缩放指数来量化样本效率。
  • 在多个训练步数(如10个周期、32个周期)提取经验NTK,并在固定测试集上重新训练以评估其表征能力的演化。
  • 研究在神经网络、无限NTK和经验NTK之间采用一致的超参数(学习率、批量大小、优化器),以确保在NTK参数化下的公平比较。
  • 通过在不同学习率、批量大小和优化器下的消融实验,验证了研究结果的稳健性。
  • 时间缩放分析追踪了在不同训练时间提取的经验NTK的测试误差,揭示其持续改进而非早期饱和。

实验结果

研究问题

  • RQ1在真实数据集上,经验NTK和无限NTK是否表现出与有限宽度神经网络相同的数据缩放指数?
  • RQ2在固定数量样本上对经验NTK进行预训练,能否弥合其与真实神经网络之间的泛化差距?
  • RQ3经验NTK是否在训练早期即稳定,还是在整个训练过程中持续改进?
  • RQ4经验NTK的性能如何随时间演变,是否能捕捉原始神经网络的完整缩放行为?

主要发现

  • 在相同超参数和真实数据集(如CIFAR-10和SVHN)下,有限宽度神经网络在初始化时即表现出优于经验NTK和无限NTK的数据缩放指数。
  • 随着网络宽度增加,测试性能反而下降并趋近于无限NTK的表现,这与‘过度参数化总是提升泛化能力’的普遍认知相矛盾。
  • 即使在经验NTK上对固定数量样本进行预训练,其数据缩放指数仍劣于对应神经网络,表明其表征能力存在持续限制。
  • 经验NTK在整个训练过程的大部分时间里持续均匀改进,未观察到学习速度减缓的相变阶段,这与早期稳定化的先前主张相矛盾。
  • 在任意固定训练时间 $t$ 提取的核函数 $K^t_{ ext{fit}}$ 均无法匹配原始神经网络的数据缩放特性,表明必须依赖完整的训练轨迹才能捕捉正确的缩放定律。
  • 在对数-对数图中,训练过程中提取的经验NTK的测试误差始终呈现恒定的改进斜率,即使在32个周期后也未显示出收敛或减速的迹象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。