Skip to main content
QUICK REVIEW

[论文解读] Learning Compact Recurrent Neural Networks

Zhiyun Lu, Vikas Sindhwani|arXiv (Cornell University)|Apr 9, 2016
Speech Recognition and Synthesis参考文献 9被引用 21
一句话总结

本文提出一种混合压缩策略,通过在底层使用类似托普利茨(Toeplitz-like)结构矩阵,在顶层使用共享低秩因子,对循环神经网络(RNNs)和长短期记忆网络(LSTMs)进行紧凑化处理。该方法在仅导致词错误率(WER)增加0.3%的情况下,将LSTM参数减少了75%,表明单元状态的保留对性能至关重要,而循环和非循环权重的可压缩性相似。

ABSTRACT

Recurrent neural networks (RNNs), including long short-term memory (LSTM) RNNs, have produced state-of-the-art results on a variety of speech recognition tasks. However, these models are often too large in size for deployment on mobile devices with memory and latency constraints. In this work, we study mechanisms for learning compact RNNs and LSTMs via low-rank factorizations and parameter sharing schemes. Our goal is to investigate redundancies in recurrent architectures where compression can be admitted without losing performance. A hybrid strategy of using structured matrices in the bottom layers and shared low-rank factors on the top layers is found to be particularly effective, reducing the parameters of a standard LSTM by 75%, at a small cost of 0.3% increase in WER, on a 2,000-hr English Voice Search task.

研究动机与目标

  • 探究循环架构中的冗余性,以实现在不损失性能的前提下高效压缩模型。
  • 评估多种压缩技术——低秩分解、基于哈希的参数共享以及结构化矩阵——在RNNs和LSTMs中的表现。
  • 确定在深层LSTM架构中,跨层、门结构和权重类型的最佳压缩策略。
  • 开发一种混合压缩框架,在语音识别任务中平衡参数减少与识别准确率。

提出的方法

  • 在LSTM的底层权重中应用具有低位移秩的类似托普利茨(Toeplitz-like)结构矩阵,实现类似卷积的计算。
  • 在顶层使用共享低秩分解,通过降低秩的投影矩阵减少参数量。
  • 实施一种混合架构,结合早期层的结构化矩阵与深层的共享低秩投影。
  • 对不同组件进行压缩评估:循环权重(U)、非循环权重(W)以及各个门(输入门、遗忘门、输出门、单元状态)。
  • 在2,000小时英语语音搜索任务上训练模型,并通过WER测量评估性能权衡。
  • 使用完整模型的软标签指导小型压缩模型中的知识蒸馏。

实验结果

研究问题

  • RQ1在LSTM架构中,何处存在最大冗余,可实现高效压缩?
  • RQ2不同压缩技术——低秩分解、基于哈希的参数共享和结构化矩阵——在性能和效率上的表现如何比较?
  • RQ3压缩循环权重(U)或非循环权重(W)是否会产生不同的性能结果?
  • RQ4哪些门(输入门、遗忘门、输出门、单元状态)对压缩最敏感,压缩应如何优先排序?
  • RQ5结合结构化矩阵与共享低秩投影的混合压缩策略,能否在实现显著参数减少的同时保持最小的准确率损失?

主要发现

  • 在底层使用类似托普利茨(Toeplitz-like)结构矩阵,在实现激进参数压缩方面优于哈希法和低秩分解。
  • 在顶层使用共享低秩因子,对网络整体参数压缩极为有效。
  • 采用底层使用类似托普利茨矩阵、顶层使用共享低秩投影的混合策略,可将参数减少75%,同时仅导致WER增加0.3%。
  • 压缩循环权重或非循环权重的性能表现相似,表明二者在可压缩性上无显著差异。
  • 单元状态是最关键的保留组件;压缩它会导致WER增加0.4%,而压缩其他门则产生较小但可测量的影响。
  • 同时压缩所有门(输入门、遗忘门、输出门)会使WER增加0.5%,参数量减少0.14m,表明选择性压缩之外存在收益递减现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。