[论文解读] Understanding Scaling Laws for Recommendation Models
本文建立了深度学习推荐模型(DLRM)的经验缩放定律,表明点击率(CTR)性能与模型规模、数据规模和计算量之间呈幂律加常数关系。研究发现参数缩放已接近饱和,因此在架构取得突破前,数据缩放是最高效的优化路径。
Scale has been a major driving force in improving machine learning performance, and understanding scaling laws is essential for strategic planning for a sustainable model quality performance growth, long-term resource planning and developing efficient system infrastructures to support large-scale models. In this paper, we study empirical scaling laws for DLRM style recommendation models, in particular Click-Through Rate (CTR). We observe that model quality scales with power law plus constant in model size, data size and amount of compute used for training. We characterize scaling efficiency along three different resource dimensions, namely data, parameters and compute by comparing the different scaling schemes along these axes. We show that parameter scaling is out of steam for the model architecture under study, and until a higher-performing model architecture emerges, data scaling is the path forward. The key research questions addressed by this study include: Does a recommendation model scale sustainably as predicted by the scaling laws? Or are we far off from the scaling law predictions? What are the limits of scaling? What are the implications of the scaling laws on long-term hardware/system development?
研究动机与目标
- 刻画深度学习推荐模型(DLRM)架构的经验缩放定律,特别是点击率(CTR)预测的性能表现。
- 评估在数据规模、模型参数和计算预算三个维度上的缩放效率。
- 判断当前推荐模型的缩放趋势是否与理论缩放定律一致,或是否存在显著偏离。
- 通过预测未来模型规模和资源需求,为长期系统与硬件设计提供指导。
- 评估嵌入参数(在以往研究中常被忽略)对整体模型缩放行为的影响。
提出的方法
- 在模型规模(N)、数据规模(D)和计算预算(C)三个维度上,跨三个数量级的范围内实证测量CTR模型性能。
- 将性能曲线拟合至幂律加常数函数:$ L(x) = \alpha x^{-\beta} + \gamma $,其中 $ x $ 代表 D、N 或 C。
- 比较四种缩放方案:垂直/水平嵌入缩放、全连接层缩放和整体MLP宽度缩放。
- 在所有实验中使用归一化交叉熵损失作为性能指标。
- 通过指数 $ \beta $ 和常数 $ \gamma $ 分析缩放效率,其中 $ \gamma $ 表示在无限规模下的理论性能上限。
- 基于拟合得到的幂律模型,利用数据效率、参数效率和计算效率指标比较不同缩放技术。
实验结果
研究问题
- RQ1推荐模型是否能按照幂律预测实现可持续缩放,还是存在显著偏离?
- RQ2在提升CTR模型性能方面,数据缩放、参数缩放和计算缩放的相对效率如何?
- RQ3在性能增益与资源投入的比值上,不同缩放方案(如嵌入表缩放(垂直/水平)、MLP层缩放和整体架构缩放)之间有何差异?
- RQ4当前DLRM架构的缩放实际极限是什么?参数缩放在何时会变得低效?
- RQ5缩放定律如何为大规模推荐系统的长期硬件与系统基础设施规划提供指导?
主要发现
- CTR模型性能与模型规模、数据规模和计算预算之间均呈幂律加常数关系,所有曲线的 $ R^2 > 0.99 $。
- 参数缩放呈现收益递减:参数缩放的指数 $ \beta $ 接近零(0–0.5),表明每增加一个参数带来的性能提升极小。
- 数据缩放是最高效的前进路径,其数据效率指数 $ \beta = 0.07 $,显著优于参数缩放。
- 计算缩放效率较高($ \beta = 0.11 $),但仍低于数据缩放,且在投资回报率(ROI)方面被数据缩放超越。
- 幂律中的常数项 $ \gamma $ 被限制在 0.98(归一化熵),表明当前模型已接近无限规模下的理论性能极限,仅差约2%。
- 嵌入参数占模型总容量的90%以上,其缩放行为至关重要——横向和纵向嵌入缩放的效率相当,但两者均低于数据缩放。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。