QUICK REVIEW
[论文解读] Factorization tricks for LSTM networks
Oleksii Kuchaiev, Boris Ginsburg|arXiv (Cornell University)|Mar 31, 2017
Neural Networks and Applications参考文献 13被引用 88
一句话总结
本文提出因子化 LSTM (F-LSTM) 和分组 LSTM (G-LSTM) 以降低参数并加速训练,在 One Billion Word Benchmark 上以更少的 RNN 参数实现接近状态 perplexity。
ABSTRACT
We present two simple ways of reducing the number of parameters and accelerating the training of large Long Short-Term Memory (LSTM) networks: the first one is "matrix factorization by design" of LSTM matrix into the product of two smaller matrices, and the second one is partitioning of LSTM matrix, its inputs and states into the independent groups. Both approaches allow us to train large LSTM networks significantly faster to the near state-of the art perplexity while using significantly less RNN parameters.
研究动机与目标
- 动机:为大规模语言模型降低 LSTM 参数数量和训练时间。
- 提出对 LSTMP 的两项修改(因式分解和分组)以降低计算和内存需求。
- 在大规模语言建模任务上评估这些方法并与强基线进行比较。
- 就何时以及如何在保持性能的同时提升训练效率提供指南。
提出的方法
- Factorized LSTM (F-LSTM) 将 4n x 2p 的仿射变换替换为两个较小矩阵的乘积 (W2*W1),其中 W1 的尺寸为 2p x r,W2 的尺寸为 r x 4n,秩 r < p。
- Group LSTM (G-LSTM) 将输入 x 和隐藏状态 h 分成独立的组,每组从 R^{2p/k} 到 R^{4n/k} 计算其自己的仿射变换,分成 k 组。
- 两种方法相比原始 LSTMP 都能减少参数数量;F-LSTM 将参数减少至 (r*2p + r*4n) 相对于 (2p*4n);G-LSTM 将计算分布到各组,从而实现模型并行。
- 该研究使用带投影(大小为 p)的 LSTMP,并在 One Billion Word Benchmark 的语言建模任务上进行测试。
- 作者指出投影大小对于控制嵌入和 softmax 大小至关重要。
实验结果
研究问题
- RQ1对 LSTM 权重矩阵进行因子分解是否能在降低参数数量并加速训练的同时保持性能?
- RQ2将 LSTM 分成独立组(G-LSTM)是否能在更少参数的前提下提供相似或更高的效率?
- RQ3在 One Billion Word Benchmark 上,F-LSTM 和 G-LSTM 相对于基线 BIGLSTM 在困惑度和训练吞吐量方面的比较如何?
- RQ4在不同分组数量或分解秩下,模型规模、速度(词/秒)和困惑度之间的权衡是什么?
主要发现
- G-LSTM 2 组在参数显著更少且训练更快的情况下达到接近基线的困惑度。
- 中间秩(F512)的 F-LSTM 训练更快、参数少于 BIGLSTM,并达到有竞争力的困惑度。
- 增加分组数(G-4、G-8)进一步降低参数量,但可能提高困惑度;G-8 在 850.4k 参数时困惑度为 39.4。
- 因式分解和分组的 LSTM 在相同的实时时间预算内训练显著更快,达到接近最先进困惑度。
- 层次化分组配置(如 G4-G8)显示在不造成大幅准确度损失的情况下提高效率的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。