Skip to main content
QUICK REVIEW

[论文解读] Dynamically Hierarchy Revolution: DirNet for Compressing Recurrent Neural Network on Mobile Devices

Jie Zhang, Xiaolong Wang|ArXiv.org|Jun 4, 2018
Speech Recognition and Synthesis参考文献 2被引用 5
一句话总结

DirNet 是一种用于循环神经网络的动态模型压缩框架,通过在分层结构中联合优化稀疏性和字典学习,实现在极低精度损失下的高比率压缩。通过动态挖掘字典原子并自适应调整每层的稀疏度,DirNet 在移动设备上实现了高达 8× 的模型压缩,同时保持实时推理能力,并在自动语音识别和语言建模任务中实现可忽略的 WER 退化。

ABSTRACT

Recurrent neural networks (RNNs) achieve cutting-edge performance on a variety of problems. However, due to their high computational and memory demands, deploying RNNs on resource constrained mobile devices is a challenging task. To guarantee minimum accuracy loss with higher compression rate and driven by the mobile resource requirement, we introduce a novel model compression approach DirNet based on an optimized fast dictionary learning algorithm, which 1) dynamically mines the dictionary atoms of the projection dictionary matrix within layer to adjust the compression rate 2) adaptively changes the sparsity of sparse codes cross the hierarchical layers. Experimental results on language model and an ASR model trained with a 1000h speech dataset demonstrate that our method significantly outperforms prior approaches. Evaluated on off-the-shelf mobile devices, we are able to reduce the size of original model by eight times with real-time model inference and negligible accuracy loss.

研究动机与目标

  • 为解决由于高计算和内存需求,大型 RNN 难以在资源受限的移动设备上部署的问题。
  • 克服现有压缩方法缺乏对各层冗余差异的动态适应性以及固定压缩率的局限性。
  • 通过联合优化层间与循环权重矩阵的压缩,实现在最小精度损失下的高比率压缩。
  • 开发一种方法,根据 RNN 中各结构和功能差异自适应地调整各分层的稀疏度。
  • 在现成移动硬件上实现实时推理,同时保持模型性能。

提出的方法

  • DirNet 采用快速字典学习算法,从每层内的投影字典矩阵中动态挖掘字典原子,实现每层特定的压缩率控制。
  • 通过共享的投影字典,联合压缩循环权重矩阵和层间权重矩阵,以保持网络中表示的一致性。
  • 根据各隐藏层的功能角色和冗余程度,自适应地为每层的稀疏编码设置不同的稀疏度水平,从而最小化性能下降。
  • 一种动态收缩机制通过参数化稀疏度控制(Θ⁰)和收缩因子(γ)调整压缩率,优化收敛性和压缩质量。
  • 该框架采用分层优化策略,迭代优化字典和稀疏编码,同时保持模型精度。
  • 通过在各层间集成共享的码书表示,提升压缩过程中的参数效率和泛化能力。

实验结果

研究问题

  • RQ1通过字典学习实现的动态、分层特定压缩,是否能在 RNN 中实现高于静态或均匀方法的压缩率?
  • RQ2在分层结构中自适应控制稀疏度,对压缩后 RNN 的模型精度和推理速度有何影响?
  • RQ3DirNet 在移动设备上将模型大小压缩至原大小的 1/8 时,能在多大程度上保持接近原始性能?
  • RQ4与 SVD 或剪枝压缩相比,动态字典原子挖掘与自适应稀疏度结合在加速和精度方面表现如何?
  • RQ5哪些参数设置(Θ⁰ 和 γ)能在压缩效率与模型性能之间实现最优权衡?

主要发现

  • DirNet 在 LibriSpeech 上实现 4.3× 压缩,参数量为 1.3M,WER 为 12.9%,与原始 10.3M 参数模型的 12.7% WER 相当;而 SVD 和 ODL 方法在相似压缩水平下 WER 退化达 3.4–3.9%。
  • 在 7.9× 压缩率下,DirNet 保持 12.9% WER,而 LSTM-SVD 和 LSTM-ODL 分别退化至 16.1% 和 14.3% WER,表明其具有更优的精度保持能力。
  • 在相同压缩水平下,DirNet 在移动 CPU 上实现 4.2× 加速,而 LSTM-SVD 和 LSTM-ODL 分别仅实现 1.4× 和 2.6× 加速。
  • 最优初始稀疏度参数 Θ⁰ = 10⁷ 和收缩因子 γ = 0.4 能在收敛速度和压缩质量之间实现良好平衡,且在 Θ⁰ 值过低时性能急剧下降。
  • 自适应分层压缩使 DirNet 在相同神经元数量下 WER 低于 LSTM-SVD,证实了分层特定稀疏度调优的优势。
  • DirNet 在实现 8× 模型压缩的同时,可在现成移动设备上实现实时推理,且精度损失可忽略,证明了其实际可部署性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。