QUICK REVIEW
[论文解读] LLaMA: Open and Efficient Foundation Language Models
Hugo Touvron, Thibaut Lavril|arXiv (Cornell University)|Feb 27, 2023
Natural Language Processing Techniques被引用 3,849
一句话总结
LLaMA 提供从 7B 到 65B 参数的开放基础语言模型,基于公开可用数据训练,与更大但封闭的模型相比具有竞争力的性能,并能在中等硬件上进行推理。
ABSTRACT
We introduce LLaMA, a collection of foundation language models ranging from 7B to 65B parameters. We train our models on trillions of tokens, and show that it is possible to train state-of-the-art models using publicly available datasets exclusively, without resorting to proprietary and inaccessible datasets. In particular, LLaMA-13B outperforms GPT-3 (175B) on most benchmarks, and LLaMA-65B is competitive with the best models, Chinchilla-70B and PaLM-540B. We release all our models to the research community.
研究动机与目标
- 仅使用公开可用数据来普及大语言模型研究的访问。
- 证明在特定的训练/推理预算下,较小的模型能够超越较大的模型。
- 展示 13B–65B 模型在标准基准测试中对领先模型的竞争性表现。
- 突出培训/推理效率以及研究人员在实际部署中的考量。
提出的方法
- 采用基于 Transformer 的架构,具备前置归一化、SwiGLU 激活和 RoPE 旋转嵌入。
- 在约 1.0–1.4T 标记上训练多种模型尺寸(7B、13B、33B、65B),使用余弦学习率调度和 AdamW 优化器。
- 使用内存高效的因果注意力实现和检查点技术,以在大型 GPU 上加速训练。
- 在公开数据集的混合上进行预训练(CommonCrawl、C4、GitHub、Wikipedia、Books、ArXiv、Stack Exchange),并进行仔细的重复数据去重和语言过滤。
- 使用 SentencePiece 的 BPE 进行分词,包括数字分割和 UTF-8 回退以实现广覆盖。

实验结果
研究问题
- RQ1开放的、公开来源的数据是否足以在多个尺度(7B–65B)训练出高质量的基础模型?
- RQ2在不同推理预算下,较小的开放模型相对于较大的专有模型在标准基准上的表现如何?
- RQ3哪些架构和训练优化能够为大语言模型带来强劲性能和实际的推理效率?
- RQ4在不使用大量自定义数据的情况下,指令微调在多大程度上能够提升开放模型的任务性能?
- RQ5在公开数据上训练的开放基础模型的偏见、毒性和碳足迹影响是什么?
主要发现
- LLaMA-13B 在大多数基准上超过 GPT-3(175B),尽管体积小了 10 倍。
- LLaMA-65B 在多项评测中与顶尖模型(Chinchilla-70B 和 PaLM-540B)具备竞争力。
- LLaMA-65B 在 Natural Questions 和 TriviaQA 的零-shot/少-shot 设置中表现出色,在某些任务上达到近似最先进的结果。
- 代码生成能力(HumanEval、MBPP)使 LLaMA 相对于多个非代码微调基线占优,在参数量越大时收益越大。
- 指令微调(LLaMA-I)提升了 MMLU 的表现,在 65B 时达到 68.9%,超越同等规模的某些其他指令微调模型。
- 研究记录了偏见和毒性模式(RealToxicityPrompts、CrowS-Pairs、WinoGender),并与 GPT-3 和 OPT 进行了比较,指出大小相关的趋势和特定领域的偏见。
- 在一个共同数据中心场景下,对训练不同模型的碳足迹进行详细分析,强调高额能源消耗,以及作者通过开放性来降低未来排放的意图。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。