[论文解读] Pruning Redundant Mappings in Transformer Models via Spectral-Normalized Identity Prior
本文提出谱归一化身份先验(SNIP),一种结构化剪枝方法,通过函数范数阈值化策略,针对Transformer模型中的整个残差模块(如注意力头、前馈网络或完整层)进行剪枝,促使这些模块变为恒等映射。结合谱归一化以稳定激活分布,SNIP在50%模型压缩率下实现了当前最优性能,在GLUE基准任务上平均准确率提升0.5–1.0%。
Traditional (unstructured) pruning methods for a Transformer model focus on regularizing the individual weights by penalizing them toward zero. In this work, we explore spectral-normalized identity priors (SNIP), a structured pruning approach that penalizes an entire residual module in a Transformer model toward an identity mapping. Our method identifies and discards unimportant non-linear mappings in the residual connections by applying a thresholding operator on the function norm. It is applicable to any structured module, including a single attention head, an entire attention block, or a feed-forward subnetwork. Furthermore, we introduce spectral normalization to stabilize the distribution of the post-activation values of the Transformer layers, further improving the pruning effectiveness of the proposed methodology. We conduct experiments with BERT on 5 GLUE benchmark tasks to demonstrate that SNIP achieves effective pruning results while maintaining comparable performance. Specifically, we improve the performance over the state-of-the-art by 0.5 to 1.0% on average at 50% compression ratio.
研究动机与目标
- 解决传统非结构化、权重级剪枝虽减少参数但无法降低推理延迟的局限性。
- 探索模块级(如注意力头、前馈子网络)的结构化剪枝,以修改模型架构并提升效率。
- 通过谱归一化稳定激活分布,提升剪枝的有效性。
- 证明基于身份诱导先验的结构化剪枝可实现优于现有方法的性能-压缩权衡。
提出的方法
- 在残差映射的函数范数上应用阈值操作,以识别并剪除不重要的非线性组件。
- 引入一种身份诱导先验,对整个子模块(如注意力头或FFN层)进行正则化,使其行为趋近于恒等函数。
- 对每个模块的权重矩阵应用谱归一化,以控制最大奇异值,稳定后激活分布。
- 在微调过程中迭代应用该方法,支持连续的压缩曲线和灵活的架构选择。
- 支持多种剪枝粒度:单个注意力头、多头注意力、前馈网络或完整层。
- 在BERT模型上对5个GLUE任务进行评估,性能在固定压缩率下进行测量。
实验结果
研究问题
- RQ1在Transformer中对整个残差模块进行结构化剪枝,是否能实现优于非结构化权重剪枝的性能-压缩权衡?
- RQ2在残差映射上施加身份诱导先验,是否能提升剪枝过程中的模型鲁棒性与泛化能力?
- RQ3谱归一化在深层Transformer模型中如何提升结构化剪枝的稳定性和有效性?
- RQ4不同剪枝粒度(单个头、多头注意力、FFN或完整层)对最终性能的影响程度如何?
- RQ5剩余的剪枝组件是否具有任务特异性?这种灵活性是否能提升压缩效率?
主要发现
- SNIP在50%模型压缩率下实现当前最优性能,在5个GLUE基准任务上平均准确率较之前方法提升0.5至1.0%。
- 分别剪枝注意力子网络和前馈子网络的性能优于剪枝完整层或单个头,表明存在任务特异性的结构冗余。
- 该方法在预训练阶段产生更稀疏且受控的层映射,且在多种自然语言处理任务中均表现出一致的性能提升。
- 谱归一化显著提升了激活分布的稳定性,增强了剪枝的有效性与模型泛化能力。
- 在模块级别(如单个注意力头或FFN层)进行剪枝,相比权重级剪枝,能带来更高的推理效率和更灵活的架构设计。
- 剩余的剪枝组件在不同任务中各不相同,表明最优架构具有任务依赖性,可通过结构化剪枝自动发现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。