[论文解读] Exploring Extreme Parameter Compression for Pre-trained Language Models
本文提出一种基于Tucker张量分解的方法,用于极端参数压缩预训练语言模型,在BERT的Transformer层中实现高达48倍的参数减少,同时性能损失极小。该方法采用高效的重建协议与知识蒸馏技术,使模型在仅保留200万参数(不包括嵌入层)的情况下,仍能保持BERT-base 96.7%的性能,并实现2.7倍的推理加速。
Recent work explored the potential of large-scale Transformer-based pre-trained models, especially Pre-trained Language Models (PLMs) in natural language processing. This raises many concerns from various perspectives, e.g., financial costs and carbon emissions. Compressing PLMs like BERT with negligible performance loss for faster inference and cheaper deployment has attracted much attention. In this work, we aim to explore larger compression ratios for PLMs, among which tensor decomposition is a potential but under-investigated one. Two decomposition and reconstruction protocols are further proposed to improve the effectiveness and efficiency during compression. Our compressed BERT with ${1}/{7}$ parameters in Transformer layers performs on-par with, sometimes slightly better than the original BERT in GLUE benchmark. A tiny version achieves $96.7\%$ performance of BERT-base with $ {1}/{48} $ encoder parameters (i.e., less than 2M parameters excluding the embedding layer) and $2.7 imes$ faster on inference. To show that the proposed method is orthogonal to existing compression methods like knowledge distillation, we also explore the benefit of the proposed method on a distilled BERT.
研究动机与目标
- 探索预训练语言模型(PLMs)的极端参数压缩比,尤其是超越现有方法的压缩能力。
- 应对大型PLM(如BERT)带来的高计算与部署成本挑战。
- 研究张量分解——特别是Tucker分解——作为PLM高效压缩方法的可行性与有效性。
- 开发高效的重建协议,在降低推理开销的同时保持模型准确性。
- 通过将该方法应用于蒸馏模型(如TinyBERT)验证其与知识蒸馏的正交性。
提出的方法
- 提出一个正式框架,用于分析PLM中的矩阵与张量分解,区分层内矩阵与层间矩阵的冗余性。
- 应用Tucker分解(IV)对注意力与前馈网络中的权重矩阵进行因子分解,使用共享的U和V矩阵及核心张量C。
- 提出一种基于重排的重建协议,在保持模型输出的同时最小化推理过程中的额外计算。
- 利用知识蒸馏将压缩模型的预测结果与原始模型输出对齐,缓解低秩分解带来的近似误差。
- 在Tucker分解中引入“矩阵库”机制,使各层参数规模几乎保持恒定,提升压缩效率。
- 在BERT上验证该方法,并将其扩展至蒸馏模型(如TinyBERT),显示其与知识蒸馏具有互补优势。
实验结果
研究问题
- RQ1Tucker分解是否能在保持性能的前提下,实现比矩阵分解或张量列车分解更高的压缩比?
- RQ2如何最小化分解后模型的重建开销,以维持推理速度?
- RQ3在注意力与前馈网络中,参数冗余在多大程度上可通过张量分解被有效利用?
- RQ4当该方法应用于已蒸馏的模型(如TinyBERT)时,其有效性是否依然成立?
- RQ5在极端压缩比下(如原始参数的1/48),压缩模型是否仍能保持高精度?
主要发现
- 在Transformer层中将参数压缩至原始大小的1/7的BERT模型,在GLUE基准测试中性能与原始BERT相当。
- 仅含1/48的编码器参数(不含嵌入层,参数少于200万)的微型BERT变体,保留了BERT-base 96.7%的性能。
- 压缩后的模型相比原始BERT实现2.7倍的推理速度提升。
- 在压缩比与参数效率方面,Tucker分解优于矩阵分解与张量列车分解。
- 该方法与知识蒸馏具有正交性,通过应用于TinyBERT得到验证,进一步提升了性能且额外开销极小。
- 对因子向量的分析揭示了权重矩阵中跨层的相似性模式,表明各层间学习表征具有结构一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。