Skip to main content
QUICK REVIEW

[论文解读] Simplified Long Short-term Memory Recurrent Neural Networks: part III

Atra Akandeh, Fathi M. Salem|arXiv (Cornell University)|Jul 14, 2017
Neural Networks and Applications参考文献 6被引用 6
一句话总结

本论文提出两种新颖且计算高效的LSTM变体——LSTM10和LSTM11——通过将单元状态更新中的权重矩阵替换为可学习向量,并应用Hadamard(逐点)乘法以减少参数量。这些模型在计算资源受限环境下表现出显著降低的计算负载,同时保持与标准LSTM相当的稳定性和性能,测试准确率最高达95.31%。

ABSTRACT

This is part III of three-part work. In parts I and II, we have presented eight variants for simplified Long Short Term Memory (LSTM) recurrent neural networks (RNNs). It is noted that fast computation, specially in constrained computing resources, are an important factor in processing big time-sequence data. In this part III paper, we present and evaluate two new LSTM model variants which dramatically reduce the computational load while retaining comparable performance to the base (standard) LSTM RNNs. In these new variants, we impose (Hadamard) pointwise state multiplications in the cell-memory network in addition to the gating signal networks.

研究动机与目标

  • 为在资源受限环境中部署而降低标准LSTM网络的计算负担。
  • 探索超越门控机制的参数减少策略,重点关注主单元记忆网络。
  • 评估在单元状态更新中用向量替代权重矩阵并应用Hadamard乘积操作的影响。
  • 在大幅降低模型复杂度和推理时间的同时,保持高性能。

提出的方法

  • 将单元状态更新中的权重矩阵 $ U_c $ 替换为可学习向量 $ u_c $,实现与隐藏状态的逐点乘法。
  • 通过使用可学习向量 $ u_i, u_f, u_o $ 替代权重矩阵来实现门控信号中的Hadamard(逐元素)乘法,以减少隐藏状态的交互参数。
  • 将LSTM10定义为门控方程中无偏置项的模型,而LSTM11则在门控信号中重新引入偏置项。
  • 使用标准激活函数(tanh、sigmoid、ReLU),并在MNIST数据集上使用Keras、RMProp优化器和分类交叉熵损失进行训练。
  • 通过评估不同学习率 $ \eta $、激活函数和模型变体的性能,识别出鲁棒的配置。

实验结果

研究问题

  • RQ1能否通过将LSTM单元状态更新中的权重矩阵 $ U_c $ 替换为可学习向量,在不降低性能的前提下显著减少计算成本?
  • RQ2在门控和单元状态方程中对隐藏状态应用Hadamard乘法,对模型准确率和训练稳定性有何影响?
  • RQ3不同激活函数(tanh、sigmoid、ReLU)对简化LSTM变体(尤其是LSTM10)的性能有何影响?
  • RQ4调整学习率 $ \eta $ 是否能提升简化模型的性能,特别是使用ReLU激活的LSTM10?
  • RQ5与标准LSTM和基线bRNN(LSTM6)相比,所提出的变体(LSTM10和LSTM11)在准确率、参数量和训练时间方面表现如何?

主要发现

  • LSTM11在使用tanh激活函数且 $ \eta = 0.004 $ 时达到95.31%的测试准确率,表现出与标准LSTM相当的强性能。
  • 使用ReLU激活的LSTM10在 $ \eta = 0.001 $ 时未能有效收敛,仅达到52.26%的测试准确率,且随着 $ \eta $ 增大,性能进一步下降。
  • 参数量从标准LSTM的52,610个显著降低至LSTM11的4,610个和LSTM10的4,310个,大幅减轻了计算负载。
  • 每轮训练时间从标准LSTM的30秒减少至LSTM10的18秒和LSTM11的19秒,表明推理效率得到提升。
  • LSTM11在所有激活函数下均优于LSTM10,尤其在使用ReLU时,其在 $ \eta = 0.005 $ 时达到95.82%的测试准确率,表明门控信号中偏置项的重要性。
  • 最佳结果出现在使用ReLU激活的LSTM11且 $ \eta = 0.005 $ 时,测试准确率达到96.35%,表明学习率调节能有效恢复简化模型的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。