Skip to main content
QUICK REVIEW

[论文解读] E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity

Yunwei Li, Lin Niu|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用 4
一句话总结

E-Sparse 提出了一种针对大语言模型(LLMs)的一次性、基于熵的 N:M 稀疏化方法,通过隐藏状态特征的信息熵来指导通道级剪枝,并结合全局与局部通道重排策略以保持模型精度。该方法在 LLaMA 和 OPT 模型上实现了高达 1.53× 的推理加速和 43.52% 的内存节省,且精度损失极小,借助 FasterTransformer 中针对 NVIDIA Ampere GPU 优化的自定义稀疏 GEMM 实现。

ABSTRACT

Traditional pruning methods are known to be challenging to work in Large Language Models (LLMs) for Generative AI because of their unaffordable training process and large computational demands. For the first time, we introduce the information entropy of hidden state features into a pruning metric design, namely E-Sparse, to improve the accuracy of N:M sparsity on LLM. E-Sparse employs the information richness to leverage the channel importance, and further incorporates several novel techniques to put it into effect: (1) it introduces information entropy to enhance the significance of parameter weights and input feature norms as a novel pruning metric, and performs N:M sparsity without modifying the remaining weights. (2) it designs global naive shuffle and local block shuffle to quickly optimize the information distribution and adequately cope with the impact of N:M sparsity on LLMs' accuracy. E-Sparse is implemented as a Sparse-GEMM on FasterTransformer and runs on NVIDIA Ampere GPUs. Extensive experiments on the LLaMA family and OPT models show that E-Sparse can significantly speed up the model inference over the dense model (up to 1.53X) and obtain significant memory saving (up to 43.52%), with acceptable accuracy loss.

研究动机与目标

  • 解决在真实生成式 AI 应用中部署大语言模型(LLMs)所面临的高计算与内存开销问题。
  • 克服传统剪枝方法在 LLM 中的局限性,这些方法通常需要昂贵的微调,且未能充分利用硬件优化的稀疏模式。
  • 设计一种后训练、一次性剪枝方法,实现无需微调的高效 N:M 稀疏化,适用于现代 GPU 的快速部署。
  • 通过引入信息熵作为通道重要性的新颖度量指标,提升 LLM 中 N:M 稀疏化的精度,以捕捉隐藏状态特征的信息丰富度。
  • 开发一种通道重排策略,以缓解剪枝过程中信息在通道间集中分布所导致的精度下降问题。

提出的方法

  • 提出一种新颖的剪枝度量方法,结合隐藏状态特征的信息熵、输入特征范数和参数幅值,以评估通道重要性。
  • 利用信息熵量化隐藏状态中每个通道内的信息丰富度,从而更准确地识别出需要保留的关键参数。
  • 应用全局朴素重排和局部块重排策略,将信息在通道间重新分布,降低信息集中度,从而在 N:M 剪枝后保持性能。
  • 在 FasterTransformer 中实现一个针对 N:M 稀疏化的自定义稀疏 GEMM 内核,原生支持 NVIDIA Ampere GPU 的稀疏张量核心加速。
  • 执行一次性剪枝,无需微调或权重更新,完全依赖基于熵的度量与重排技术来维持精度。
  • 将该方法无缝集成到推理流水线中,仅引入极小开销,实现对标准 LLM 推理工作负载的高效部署。

实验结果

研究问题

  • RQ1隐藏状态特征的信息熵是否能作为比仅使用幅值或范数更有效的度量指标,以指导 LLM 中的 N:M 稀疏化?
  • RQ2信息在通道间的集中程度如何影响 LLM 中 N:M 结构化剪枝的精度?
  • RQ3通道重排技术(包括全局与局部)是否能有效缓解 LLM 中结构化剪枝导致的精度下降问题?
  • RQ4基于熵的 N:M 稀疏化在不进行微调的情况下,能在多大程度上加速 LLM 推理并减少内存使用?
  • RQ5与现有后训练剪枝方法(如 Wanda 或 SparseGPT)相比,该方法在速度、内存和精度方面表现如何?

主要发现

  • 与 FP16 密集基线相比,E-Sparse 在 LLaMA 和 OPT 模型上的推理速度最高可提升 1.53 倍,且在上下文编码和解码阶段均保持一致的加速效果。
  • 该方法在 LLaMA 模型上最高可将内存使用量减少 43.52%,且模型越大,内存节省比例越高。
  • 在 LLaMA 模型上,E-Sparse 的困惑度相比当前最先进方法提升了 1.32 个点,表明在激进剪枝下仍具备卓越的精度保持能力。
  • 基于熵的剪枝与通道重排相结合,通过在 N:M 稀疏化过程中保留信息丰富的通道,显著降低了精度损失。
  • FasterTransformer 中的自定义稀疏 GEMM 内核使 NVIDIA Ampere GPU 上的推理效率显著提升,A100 硬件上最高可降低 34.8% 的延迟。
  • 该方法在不同模型尺寸和序列长度下均保持优异性能,展现出在真实部署场景中的强大鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。