[论文解读] SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
SOLAR 10.7B 引入了一种简单而高效的深度扩展(DUS)方法,通过深度缩放和持续预训练,将基于 Llama 2 的 32 层模型扩展至 107 亿参数,实现了自然语言处理基准测试的最先进性能,并在指令遵循任务中超越了 Mixtral-8x7B-Instruct,该模型以 Apache 2.0 许可证发布,具有广泛的可及性。
We introduce SOLAR 10.7B, a large language model (LLM) with 10.7 billion parameters, demonstrating superior performance in various natural language processing (NLP) tasks. Inspired by recent efforts to efficiently up-scale LLMs, we present a method for scaling LLMs called depth up-scaling (DUS), which encompasses depthwise scaling and continued pretraining. In contrast to other LLM up-scaling methods that use mixture-of-experts, DUS does not require complex changes to train and inference efficiently. We show experimentally that DUS is simple yet effective in scaling up high-performance LLMs from small ones. Building on the DUS model, we additionally present SOLAR 10.7B-Instruct, a variant fine-tuned for instruction-following capabilities, surpassing Mixtral-8x7B-Instruct. SOLAR 10.7B is publicly available under the Apache 2.0 license, promoting broad access and application in the LLM field.
研究动机与目标
- 开发一种简单、高效且广泛兼容的大型语言模型扩展方法,无需复杂的架构改动。
- 解决从较小模型扩展高性能大语言模型的挑战,同时保持计算效率和易用性。
- 通过微调提升指令遵循能力,使模型在性能上超越更大的混合专家(MoE)模型,如 Mixtral-8x7B-Instruct。
- 通过以 Apache 2.0 许可证发布 SOLAR 10.7B 及其指令微调版本,推动开放研究。
提出的方法
- 深度扩展(DUS)通过复制基础模型,从一个模型的末尾移除 m 层,从另一个模型的开头移除 m 层,然后将两者合并,形成一个更深的模型。
- 该方法借鉴 Tan 和 Le(2019)提出的深度缩放思想,并针对 Transformer 架构进行适配,未引入混合专家或动态路由机制。
- 在缩放后,对扩展后的模型在多样化数据集组合上进行持续预训练,以恢复并提升性能。
- 指令微调版本 SOLAR 10.7B-Instruct 在 Alpaca-GPT4、OpenOrca 和 Synth. Math-Instruct 等指令遵循数据集上进行微调。
- 评估了平均加权和 SLERP 等模型融合技术以组合模型头,最终基于性能稳定性选择 'Merge v1'。
- 该方法完全兼容 HuggingFace 和标准大语言模型框架,无需对训练或推理流程进行任何修改。

实验结果
研究问题
- RQ1一种简单的深度缩放策略是否能在不引入架构复杂性的情况下,有效将小型大语言模型扩展为高性能的大模型?
- RQ2在深度缩放后进行持续预训练,是否相比仅缩放能显著提升模型性能?
- RQ3经过深度扩展的模型是否能在指令遵循基准测试中超越更大的、更复杂的模型(如 Mixtral-8x7B-Instruct)?
- RQ4在最终聚合阶段,不同模型融合策略的性能结果有多稳健?
- RQ5DUS 方法在多大程度上保持了性能表现,并与标准大语言模型框架保持兼容性?
主要发现
- SOLAR 10.7B 在多个自然语言处理基准测试中达到最先进性能,优于 Llama 2 和 Mistral 7B 在各类任务中的表现。
- SOLAR 10.7B-Instruct 在所有评估的指令遵循指标上均超越 Mixtral-8x7B-Instruct,表明当正确扩展时,较小的模型可超越更大的 MoE 模型。
- 深度扩展(DUS)方法实现了大语言模型的高效扩展,对训练和推理框架的改动极小,同时保持与 HuggingFace 的兼容性。
- 通过平均加权和 SLERP 进行的模型融合在性能上差异极小,表明当候选模型具备互补优势时,该方法对融合策略具有鲁棒性。
- 该模型以 Apache 2.0 许可证发布,实现了社区的广泛访问,推动了大语言模型研究的开放创新。
- 该方法在评估中表现出较低的数据污染水平,表明数据清洗与处理协议严谨有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。