Skip to main content
QUICK REVIEW

[论文解读] Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster

Nolan Dey, Gurpreet Gosal|arXiv (Cornell University)|Apr 6, 2023
Topic Modeling被引用 24
一句话总结

简要结论:Cerebras-GPT 使用 Chinchilla 缩放和最大更新参数化 (µP) 在 Pile 数据集上将计算最优的类 GPT 模型从 111M 到 13B 参数训练,发布开源模型和放大规律,展示开放模型在训练效率方面的现有最佳水平。

ABSTRACT

We study recent research advances that improve large language models through efficient pre-training and scaling, and open datasets and tools. We combine these advances to introduce Cerebras-GPT, a family of open compute-optimal language models scaled from 111M to 13B parameters. We train Cerebras-GPT models on the Eleuther Pile dataset following DeepMind Chinchilla scaling rules for efficient pre-training (highest accuracy for a given compute budget). We characterize the predictable power-law scaling and compare Cerebras-GPT with other publicly-available models to show all Cerebras-GPT models have state-of-the-art training efficiency on both pre-training and downstream objectives. We describe our learnings including how Maximal Update Parameterization ($μ$P) can further improve large model scaling, improving accuracy and hyperparameter predictability at scale. We release our pre-trained models and code, making this paper the first open and reproducible work comparing compute-optimal model scaling to models trained on fixed dataset sizes. Cerebras-GPT models are available on HuggingFace: https://huggingface.co/cerebras.

研究动机与目标

  • 结合最近的大型语言模型效率缩放技术,创建计算最优的开源模型与缩放规律。
  • 在 Pile 上按 Chinchilla 数据效率规则进行预训练,以最大化每单位计算的性能。
  • 对上游(Pile)和下游任务进行评估,以建立开源模型的帕累托最优前沿。
  • 展示最大更新参数化(µP)如何在不同规模上改进稳定性、准确性和超参数迁移。
  • 发布预训练模型和代码,以实现可复现性与社区使用。

提出的方法

  • 类似 GPT-3 的自回归变换器解码器结构,在所有解码块中采用密集注意力。
  • 在 Pile 数据集上以每个参数 20 个标记进行预训练,参数规模从 111M 到 13B,以提升计算效率(Chinchilla 规则)。
  • 使用 AdamW 优化、线性学习率衰减、梯度裁剪,以及混合精度(首选 bf16 的 FP16/bfloat16)。
  • 在 Pile 测试集上以交叉熵进行评估并与公开模型比较;必要时将词表诱导的损失重新归一化到 GPT-2 词表。
  • 研究标准参数化(SP)与最大更新参数化(µP),评估稳定性和迁移性;将 µTransfer 应用于缩放超参数。
  • 记录在 Andromeda Cerebras Wafer-Scale Cluster 上的训练过程,并在 HuggingFace 发布模型和代码。

实验结果

研究问题

  • RQ1在遵循 Chinchilla 类数据效率的前提下,Pile 上语言模型预训练的计算高效缩放规律是什么?
  • RQ2在可比规模的开源模型中,Cerebras-GPT 是否在上游和下游任务上实现了最先进的训练效率?
  • RQ3最大更新参数化(µP)是否在不同规模的模型上提升稳定性、准确性和超参数迁移?
  • RQ4计算最优模型在下游性能和效率方面与固定数据集规模的模型相比如何?
  • RQ5在预训练计算与推理计算之间取得平衡对总部署成本意味着什么?

主要发现

  • Cerebras-GPT 模型(111M–13B)在 Pile 上为预训练和下游任务建立了每参数 20 个标记以下的计算高效帕累托前沿。
  • µP 模型相较于 SP 模型,在 Pile 测试损失上平均提升约 0.43%,下游准确性提升约 1.7%,且缩放更具预测性。
  • 在多样任务集上,13B 模型在同等规模的开源模型中往往实现了最佳的平均下游表现。
  • 每参数 20 个标记的预训练实现了与 DeepMind 的 Chinchilla 发现一致的计算高效缩放,计算前沿外推也符合更大规模的预期。
  • 在考虑训练加推理成本时,Cerebras-GPT 变体在相当大的推理代币预算下(例如约 200B 代币)可能比固定标记基线更具成本效益。
  • 论文发布预训练权重和代码(HuggingFace、Cerebras Modelzoo),并提供关于稳定缩放的详细 µP 指引。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。