[论文解读] Navigating Scaling Laws: Compute Optimality in Adaptive Model Training
本文提出了一种用于视觉Transformer的自适应训练策略,通过在训练过程中动态调整模型结构——特别是图像块大小(patch size)和宽度(width)——以实现计算效率最优。该方法基于神经网络缩放定律调度这些参数,在保持或提升准确率的同时,将所需FLOPs减少50%以上。
In recent years, the state-of-the-art in deep learning has been dominated by very large models that have been pre-trained on vast amounts of data. The paradigm is very simple: investing more computational resources (optimally) leads to better performance, and even predictably so; neural scaling laws have been derived that accurately forecast the performance of a network for a desired level of compute. This leads to the notion of a `compute-optimal' model, i.e. a model that allocates a given level of compute during training optimally to maximize performance. In this work, we extend the concept of optimality by allowing for an `adaptive' model, i.e. a model that can change its shape during training. By doing so, we can design adaptive models that optimally traverse between the underlying scaling laws and outpace their `static' counterparts, leading to a significant reduction in the required compute to reach a given target performance. We show that our approach generalizes across modalities and different shape parameters.
研究动机与目标
- 为解决静态模型训练中的低效问题,即尽管已知缩放定律,但固定架构形状仍导致计算资源利用不充分。
- 探究在训练过程中动态调整模型结构是否能实现更快收敛并降低给定性能目标下的计算成本。
- 基于经验性缩放定律,开发一种系统化且可扩展的策略,用于调度视觉Transformer中的形状参数(图像块大小与宽度)。
- 证明自适应模型在计算效率方面可超越静态模型,同时保持或超过性能目标。
提出的方法
- 该方法利用神经网络缩放定律,预测在每个计算水平下最优的模型配置(图像块大小或宽度)。
- 对于图像块大小的自适应,模型采用调度策略,在不同图像块大小之间切换,基于每单位FLOP的性能增益预测进行调整。
- 对于宽度自适应,模型从较小的初始宽度(例如192)逐步扩展至更大宽度(例如384、768),采用一种简单的扩展机制,保留原始权重并随机初始化新增参数。
- 该扩展过程应用于所有层,包括注意力权重、MLP权重和归一化参数,确保与Transformer架构的兼容性。
- 调度器根据哪条缩放定律在下一阶段计算增量中提供最陡峭的性能增益,选择下一个形状参数(图像块大小或宽度)。
- 在整个训练过程中持续监控性能,并通过将自适应模型与固定大小的静态模型进行对比,验证该方法的有效性。

实验结果
研究问题
- RQ1在训练过程中动态调整模型结构(图像块大小或宽度)是否能相比静态模型实现更快收敛并减少FLOP消耗?
- RQ2在相同计算预算下,自适应模型的性能与静态模型相比如何,特别是在准确率和效率方面?
- RQ3神经网络缩放定律的原则在多大程度上可用于指导形状参数的调度,以实现计算最优?
- RQ4在形状调整期间(例如宽度扩展后)的性能下降是否能快速恢复,且模型在长期是否仍保持最优?
- RQ5所提出的自适应策略是否可推广至图像块大小与宽度之外的其他形状参数,如深度或稀疏性?
主要发现
- 在视觉Transformer中对图像块大小进行自适应调度,可将达到目标ImageNet-1k错误率所需的训练FLOPs减少50%以上,显著优于静态模型。
- 基于计算调度器的自适应模型在形状转换后性能下降能快速恢复,并始终保持与预测缩放定律的一致性。
- 宽度调度同样提升了计算效率,尽管增益略小于图像块大小自适应。
- 该方法通过在每个训练阶段持续选择每单位FLOP性能增益最大的形状配置(图像块大小或宽度),实现了计算最优性。
- 简单的扩展机制——保留原始权重并随机初始化新增参数——已足够实现性能恢复与提升,且优于更复杂的函数保持方案。
- 结果证实,动态自适应使模型能够最优地遍历多条缩放定律,在不同计算水平下充分利用每种形状配置的最佳性能特性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。