[论文解读] Llama 2: Open Foundation and Fine-Tuned Chat Models
本文介绍 Llama 2,一系列开放的预训练和微调的大型语言模型(7B 到 70B),包括 Llama 2-Chat,通过增强数据、更长的上下文、GQA,以及用于对话的 RLHF 训练,展示了较强的开源模型性能和与某些封闭模型可比的安全性。
In this work, we develop and release Llama 2, a collection of pretrained and fine-tuned large language models (LLMs) ranging in scale from 7 billion to 70 billion parameters. Our fine-tuned LLMs, called Llama 2-Chat, are optimized for dialogue use cases. Our models outperform open-source chat models on most benchmarks we tested, and based on our human evaluations for helpfulness and safety, may be a suitable substitute for closed-source models. We provide a detailed description of our approach to fine-tuning and safety improvements of Llama 2-Chat in order to enable the community to build on our work and contribute to the responsible development of LLMs.
研究动机与目标
- 展示一个开放的预训练语言模型家族(Llama 2),具有更大的数据、更长的上下文和可扩展的架构。
- 展示微调技术(SFT、RLHF),以创建针对对话优化的 Llama 2-Chat。
- 提高安全性,减少数据污染,并为社区使用提供负责任的发布策略。
提出的方法
- 在新的公开可得数据混合物上进行预训练,总计 2 trillion tokens,较大模型的上下文长度为 4k,以及 Grouped-Query Attention (GQA)。
- 微调涉及带有高质量指令数据的监督微调(SFT)和谨慎的提示/回应目标。
- 应用带有人类反馈的强化学习(RLHF),使用在大型人类偏好数据集上训练的独立 Helpfulness 和 Safety 奖励模型。
- 引入 Ghost Attention (GAtt) 以改善多轮对话流。
- 采用红队演练和以安全为重点的数据注释,对安全性进行评估和迭代。
- 在标准基准和人工评估中,将 Llama 2-Chat 与开源和部分闭源基线进行比较。
实验结果
研究问题
- RQ1像 Llama 2 这样的开放式 LLM 在标准基准和对人类评估的有用性和安全性方面,与闭源模型相比如何?
- RQ2哪些预训练数据、模型架构决策(如上下文长度、GQA)以及微调协议能为对话生成提供强大的开放 LLM?
- RQ3将有用性和安全性分开的奖励模型是否能改善对话模型的 RLHF 效果?
- RQ4哪些安全措施和评估程序对于负责任的开放发布 LLMs 有效?
主要发现
- Llama 2-Chat 在基准测试上通常优于现有开源聊天模型,在人工评估中也与某些封闭源模型具有竞争力。
- Llama 2-70B 在 MMLU 和 BBH 基准测试中取得强劲结果,在某些任务上接近但未超越某些封闭模型。
- 双奖励建模设置(Helpfulness RM 和 Safety RM)提供比基线更优的奖励预测和 RLHF 性能。
- 作者提出了负责任的发布策略、数据污染分析、红队演练结果,以及一个公共安全/对齐框架,便于社区贡献。
- 开放发布被框定为降低重现门槛并鼓励安全部署,建议对应用进行特定任务的安全性测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。