Skip to main content
QUICK REVIEW

[论文解读] Compressing Neural Language Models by Sparse Word Representations

Yunchuan Chen, Lili Mou|arXiv (Cornell University)|Oct 13, 2016
Topic Modeling参考文献 28被引用 11
一句话总结

本文提出了一种压缩的神经语言模型,通过频繁词嵌入的稀疏线性组合表示罕见词,显著降低了参数量随词汇表大小的增长。通过利用稀疏码和一种新颖的ZRegression模块以稳定NCE训练,该模型在困惑度方面表现更优,且内存占用相比标准语言模型最多减少80%,甚至优于未压缩的基线模型。

ABSTRACT

Neural networks are among the state-of-the-art techniques for language modeling. Existing neural language models typically map discrete words to distributed, dense vector representations. After information processing of the preceding context words by hidden layers, an output layer estimates the probability of the next word. Such approaches are time- and memory-intensive because of the large numbers of parameters for word embeddings and the output layer. In this paper, we propose to compress neural language models by sparse word representations. In the experiments, the number of parameters in our model increases very slowly with the growth of the vocabulary size, which is almost imperceptible. Moreover, our approach not only reduces the parameter space to a large extent, but also improves the performance in terms of the perplexity measure.

研究动机与目标

  • 为解决标准神经语言模型在资源受限环境下的高内存和高参数需求问题。
  • 通过减少模型参数随词汇表大小增长的速率,提升参数效率。
  • 增强对罕见词的表征学习,因为标准模型中罕见词因梯度更新频率低而表征效果差。
  • 通过一种新颖的ZRegression机制稳定噪声对比估计(NCE)的训练过程,以实现更好的收敛性和性能。
  • 通过参数压缩实现神经语言模型在移动设备和嵌入式系统中的高效部署。

提出的方法

  • 将罕见词嵌入表示为频繁词嵌入的稀疏线性组合(4–8个非零系数),从而降低参数量随词汇表大小的增长。
  • 使用预计算的稀疏编码方案,将罕见词映射为常用词向量的加权和,通过稀疏性保留语义信息。
  • 将相同的稀疏编码策略应用于输出层权重,类似地压缩预测子网络的参数。
  • 引入ZRegression——一种预测NCE中归一化因子$ Z_h $的回归头,以稳定训练并提升收敛性。
  • 采用结合ZRegression的噪声对比估计(NCE)对压缩模型在大规模语料上进行端到端训练。
  • 使用基于LSTM的循环编码器捕获长距离上下文信息,同时所有嵌入和输出权重均通过稀疏码进行压缩。

实验结果

研究问题

  • RQ1是否可以通过频繁词嵌入的稀疏线性组合有效压缩罕见词表征,而不会造成显著性能损失?
  • RQ2通过稀疏编码实现的参数压缩是否能实现内存消耗随词汇表大小增长呈次线性?
  • RQ3所提出的ZRegression机制是否能稳定NCE训练,并相比标准NCE提升模型性能?
  • RQ4压缩模型是否在困惑度上优于未压缩基线模型,尤其是在罕见词上的表现?
  • RQ5该压缩模型在大规模词汇表下能多大程度上实现扩展,同时保持或提升性能?

主要发现

  • 与未压缩的LSTM-z模型相比,压缩模型的内存消耗最多减少80%,且随着词汇表大小增加,参数量几乎不增长。
  • LSTM-z,w和LSTM-z,wb模型在所有词汇表大小下均优于基线LSTM-z,其中LSTM-z,w在50k词汇表测试集上达到79.75的困惑度。
  • 即使参数量显著减少,该模型仍实现了比基线更低的困惑度,表明其泛化能力更强,罕见词建模效果更优。
  • ZRegression稳定了NCE训练过程,防止了发散并减少了后期训练阶段的损失振荡。
  • 稀疏码(每个词4–8个非零值)捕捉到了有意义的语义信息,表现为性能提升和训练过程稳定。
  • 该方法使大规模语言模型能够在内存受限设备上部署,因为参数量随词汇表大小增长近乎恒定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。