[论文解读] LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery
LoRAShear 提出了一种高效、资源受限的大型语言模型(LLMs)结构化剪枝框架,通过利用 LoRA 模块依赖图和一种新型的 LoRA 半空间投影梯度(LHSPG)优化器,实现渐进式、知识保留型剪枝。该方法进一步引入基于自适应预训练和指令微调数据的动态知识恢复机制,在模型压缩至 20% 时仅造成 1.0% 的性能下降,并在 50% 压缩率下保持 82% 的性能,适用于 LLAMA-v1 模型。
Large Language Models (LLMs) have transformed the landscape of artificial intelligence, while their enormous size presents significant challenges in terms of computational costs. We introduce LoRAShear, a novel efficient approach to structurally prune LLMs and recover knowledge. Given general LLMs, LoRAShear at first creates the dependency graphs over LoRA modules to discover minimally removal structures and analyze the knowledge distribution. It then proceeds progressive structured pruning on LoRA adaptors and enables inherent knowledge transfer to better preserve the information in the redundant structures. To recover the lost knowledge during pruning, LoRAShear meticulously studies and proposes a dynamic fine-tuning schemes with dynamic data adaptors to effectively narrow down the performance gap to the full models. Numerical results demonstrate that by only using one GPU within a couple of GPU days, LoRAShear effectively reduced footprint of LLMs by 20% with only 1.0% performance degradation and significantly outperforms state-of-the-arts. The source code will be available at https://github.com/microsoft/lorashear.
研究动机与目标
- 为解决在真实部署场景中剪枝大型语言模型(LLMs)所面临的高计算成本和资源需求问题。
- 在无需完整预训练或原始预训练数据集的情况下,实现通用 LLM 的结构化剪枝。
- 通过识别并保护 LoRA 适配模型中关键且最小可移除的结构,实现在剪枝过程中保留模型知识。
- 通过使用精选数据集进行自适应、多阶段微调,恢复剪枝后丢失的一般性和领域特定知识。
- 仅使用一台 GPU 和数个 GPU 天,实现剪枝 LLM 的最先进性能。
提出的方法
- 构建 LoRA 模块上的依赖图,以识别最小可移除的结构单元,并据此划分可训练参数。
- 提出 LoRA 半空间投影梯度(LHSPG)方法,一种结构化稀疏优化技术,可在渐进式剪枝过程中将知识从冗余结构转移到关键 LoRA 结构。
- 通过迭代移除低显著性 LoRA 模块实现渐进式结构化剪枝,同时借助知识迁移保持性能。
- 提出一种动态知识恢复机制,根据性能分布自适应选择并使用预训练数据的子集,以恢复一般性知识。
- 将恢复的一般性知识与 Alpaca 等数据集上的标准指令微调相结合,以恢复指令遵循能力和领域特定能力。
- 采用两阶段微调协议:首先从精选的预训练数据中恢复一般性知识,然后通过指令微调数据进行优化。

实验结果
研究问题
- RQ1在无原始预训练数据访问的情况下,是否可在资源受限环境下高效执行 LLM 的结构化剪枝?
- RQ2在剪枝不可训练的 LLM 权重和辅助 LoRA 模块时,如何在结构化剪枝过程中保留知识?
- RQ3从预训练语料中动态选择数据对剪枝后 LLM 的知识恢复有何影响?
- RQ4通过 LHSPG 实现的知识迁移在 LoRA 适配 LLM 的渐进式剪枝过程中,能在多大程度上减少性能下降?
- RQ5是否可通过统一框架在仅使用一台 GPU 的条件下,实现高剪枝率与最小性能损失?
主要发现
- 在 20% 的剪枝率下,LoRAShear 相较于完整 LLAMA-v1 模型仅造成 1.0% 的性能下降,显著优于当前最先进方法。
- 在 50% 的剪枝率下,LoRAShear 在多个基准测试中保持了完整模型 82% 的性能,展现出在高剪枝率下的强鲁棒性。
- 在相同 20% 剪枝率下,LoRAShear 在准确率上优于 LLM-Pruner、LoRAPrune 和 WANDA 等现有方法 2.2% 至 5.0%。
- 动态知识恢复阶段(结合精选预训练数据与指令微调)对弥合与完整模型的性能差距至关重要。
- 该方法仅使用一台 A100 GPU 在数个 GPU 天内完成,对公众及资源受限用户具有实际可行性。
- 知识分布分析表明,最前和最后几组 LoRA 节点组最为敏感,支持其应被排除在剪枝之外。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。