Skip to main content
QUICK REVIEW

[论文解读] Compressing Language Models using Doped Kronecker Products

Urmish Thakker, Paul N. Whatmough|arXiv (Cornell University)|Jan 24, 2020
Blind Source Separation Techniques参考文献 20被引用 4
一句话总结

该论文提出了一种掺杂克罗内克积(DKP)压缩方法,通过引入稀疏叠加矩阵来恢复大型NLP模型在克罗内克积(KP)压缩过程中损失的精度,从而增强基于克罗内克积的模型压缩。通过引入共矩阵行丢弃正则化(CMR),DKP缓解了训练过程中的共矩阵自适应(CMA)问题,实现了对25 MB的LSTM语言模型进行25倍压缩,仅导致1.2%的困惑度增加——优于剪枝、LMF和HMD方法。

ABSTRACT

Kronecker Products (KP) have been used to compress IoT RNN Applications by 15-38x compression factors, achieving better results than traditional compression methods. However when KP is applied to large Natural Language Processing tasks, it leads to significant accuracy loss (approx 26%). This paper proposes a way to recover accuracy otherwise lost when applying KP to large NLP tasks, by allowing additional degrees of freedom in the KP matrix. More formally, we propose doping, a process of adding an extremely sparse overlay matrix on top of the pre-defined KP structure. We call this compression method doped kronecker product compression. To train these models, we present a new solution to the phenomenon of co-matrix adaption (CMA), which uses a new regularization scheme called co matrix dropout regularization (CMR). We present experimental results that demonstrate compression of a large language model with LSTM layers of size 25 MB by 25x with 1.4% loss in perplexity score. At 25x compression, an equivalent pruned network leads to 7.9% loss in perplexity score, while HMD and LMF lead to 15% and 27% loss in perplexity score respectively.

研究动机与目标

  • 解决在大型NLP模型上应用克罗内克积(KP)压缩时导致的显著精度下降问题(最高达26%)。
  • 通过引入稀疏叠加矩阵增加额外自由度,以恢复KP压缩过程中损失的模型容量。
  • 开发一种训练方法,防止共矩阵自适应(CMA)问题,该问题是DKP训练中的关键挑战,即KP与稀疏矩阵组件共同适应并导致性能下降。
  • 在与现有压缩技术相比时,实现高倍率压缩(如25倍),同时保持较低的困惑度损失。

提出的方法

  • 该方法将权重矩阵表示为克罗内克积矩阵(M_kp = B ⊗ C)与稀疏矩阵(M_sp)之和,形成 W = M_kp + M_sp。
  • 稀疏矩阵 M_sp 初始为密集状态,并在训练过程中被剪枝,使模型能够学习 M_kp 中哪些元素需要额外的自由度。
  • 引入共矩阵行丢弃正则化(CMR),对每行独立地在 M_kp 和 M_sp 的输出上应用伯努利丢弃,以防止共适应。
  • CMR 动态调整:随着 M_sp 变得更稀疏,其正则化作用逐渐减弱,从而随时间减少正则化压力。
  • 训练过程使用反向传播联合优化 M_kp 和 M_sp,其中 M_sp 的稀疏度控制整体压缩因子。
  • 该方法应用于基于LSTM的语言模型,在PTB基准上评估压缩比和困惑度。

实验结果

研究问题

  • RQ1在克罗内克积压缩的权重矩阵中添加稀疏叠加矩阵,能否恢复大型NLP模型中损失的精度?
  • RQ2将KP与稀疏矩阵结合时会引发哪些训练挑战?共矩阵自适应问题能否被有效缓解?
  • RQ3像共矩阵行丢弃正则化(CMR)这样的新型正则化方案,能否实现掺杂克罗内克积模型的稳定训练?
  • RQ4在压缩比和困惑度方面,DKP压缩方法与剪枝、低秩分解和混合方法相比表现如何?
  • RQ5在使用DKP和CMR时,可实现的最大压缩比是多少,同时保持最小的困惑度退化?

主要发现

  • DKP实现了对25 MB的LSTM语言模型25倍压缩,测试困惑度仅增加1.2%,相较于基线值82.04。
  • 在25倍压缩下,DKP相比剪枝网络将困惑度损失降低了7.9个百分点(DKP为1.2%,剪枝为7.9%)。
  • 在25倍压缩下,DKP优于HMD(15%困惑度损失)和LMF(27%损失),表现出更优的精度保持能力。
  • CMR正则化有效防止了共矩阵自适应,表现为即使在 M_sp 的高稀疏度下,训练困惑度仍保持稳定。
  • 该方法实现的压缩比比表现最佳的先前技术(Park et al., 2017)高出2.5倍,同时保持更低的困惑度。
  • 在100倍压缩下,DKP实现测试困惑度138.3,相比基线值150.737提升了4个点,表明其在可控稀疏度下具有良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。