Skip to main content
QUICK REVIEW

[论文解读] A Neural Scaling Law from the Dimension of the Data Manifold

Utkarsh Sharma, Jared Kaplan|arXiv (Cornell University)|Apr 22, 2020
Neural Networks and Applications参考文献 24被引用 19
一句话总结

本文通过将缩放指数 α 与数据流形的内在维数 d 关联,提出了对观测到的神经网络缩放定律的理论解释——即模型损失随参数量呈幂律缩放。通过教师/学生框架及在图像和语言模型上的实证测试,证明了 α ≈ 4/d,确认了数据流形的内在维数从根本上决定了跨模态的泛化缩放行为。

ABSTRACT

When data is plentiful, the loss achieved by well-trained neural networks scales as a power-law $L \propto N^{-α}$ in the number of network parameters $N$. This empirical scaling law holds for a wide variety of data modalities, and may persist over many orders of magnitude. The scaling law can be explained if neural models are effectively just performing regression on a data manifold of intrinsic dimension $d$. This simple theory predicts that the scaling exponents $α\approx 4/d$ for cross-entropy and mean-squared error losses. We confirm the theory by independently measuring the intrinsic dimension and the scaling exponents in a teacher/student framework, where we can study a variety of $d$ and $α$ by dialing the properties of random teacher networks. We also test the theory with CNN image classifiers on several datasets and with GPT-type language models.

研究动机与目标

  • 解释为何神经网络损失在不同数据模态下随模型规模呈幂律缩放。
  • 解释为何缩放指数 α 在不同架构(如LSTM与Transformer)下基本保持不变,尽管架构存在差异。
  • 探究数据流形内在维数 d 在决定缩放指数 α 中的作用。
  • 检验神经网络在低维数据流形上执行回归的假设,其缩放行为由子区域尺寸减小所主导。
  • 在多种模型类型和数据分布上,通过实证方法验证理论预测 α ≈ 4/d。

提出的方法

  • 提出一个推测性理论:神经网络将内在维数为 d 的数据流形划分为更小的子区域,随着子区域尺寸减小,损失降低。
  • 推导出理论预测:对于交叉熵损失和均方误差损失,缩放指数 α 满足 α ≈ 4/d。
  • 通过使用随机教师网络的教师/学生框架,独立控制 d 和 α,实现对理论的系统性检验。
  • 使用最近邻距离方法(TwoNN 和 MLE)测量训练模型最后层激活的内在维数 d。
  • 在图像数据集(如 CIFAR10、MNIST 等)上训练简单 CNN,并训练 GPT 类模型,以在真实场景中测试缩放定律并测量 d。
  • 使用统计验证方法评估在数据密度、邻居数量和模型初始化变化下 ID 估计的稳健性。

实验结果

研究问题

  • RQ1数据流形的内在维数 d 是否能预测神经网络损失缩放中的缩放指数 α?
  • RQ2为何缩放指数 α 在不同架构(如 LSTMs 和 Transformers)下近似保持不变?
  • RQ3为何幂律缩放行为能在模型规模的多个数量级范围内持续存在?
  • RQ4在高维情况下,ID 估计方法在多大程度上能准确反映真实的流形维数?
  • RQ5理论预测 α ≈ 4/d 是否能在包括图像和语言数据在内的多种数据模态中得到实证验证?

主要发现

  • 本文确认,在多个数据集和模型类型(包括图像分类器和 GPT 风格语言模型)中,缩放指数 α 满足 α ≈ 4/d。
  • 在教师/学生实验中,测得的 α 值与通过独立估计的内在维数 d 的预测值高度一致,验证了理论模型。
  • 对训练后 CNN 的 ID 测量显示,其值随模型规模 N 变化极小,表明 d 是数据流形的稳定属性,而非模型容量的函数。
  • 对于 GPT 类模型,最终层激活的内在维数与观测到的缩放指数相关,支持了在自回归语言建模中该理论的有效性。
  • ID 估计方法在 d ≤ 20 时表现可靠,但在高维时倾向于低估 d,尽管这种系统性偏差可能不破坏 d–α 关系。
  • 该理论解释了 α 的架构无关性:由于缩放仅依赖于 d 而非模型结构,当 d 固定时,不同架构的缩放行为相似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。