Skip to main content
QUICK REVIEW

[论文解读] Adaptive Pruning of Neural Language Models for Mobile Devices

Raphael Tang, Jimmy Lin|arXiv (Cornell University)|Sep 27, 2018
Advanced Neural Network Applications参考文献 19被引用 4
一句话总结

本文提出对准循环神经网络(QRNNs)进行自适应剪枝,以实现移动语言建模中的运行时精度-效率权衡调节,通过推理时剪枝技术实现。实验表明,$L_0$ 正则化剪枝在困惑度-精度平衡方面表现最佳,在树莓派上相比最先进模型实现 40% 的能效降低,且困惑度仅增加 17%。

ABSTRACT

Neural language models (NLMs) exist in an accuracy-efficiency tradeoff space where better perplexity typically comes at the cost of greater computation complexity. In a software keyboard application on mobile devices, this translates into higher power consumption and shorter battery life. This paper represents the first attempt, to our knowledge, in exploring accuracy-efficiency tradeoffs for NLMs. Building on quasi-recurrent neural networks (QRNNs), we apply pruning techniques to provide a "knob" to select different operating points. In addition, we propose a simple technique to recover some perplexity using a negligible amount of memory. Our empirical evaluations consider both perplexity as well as energy consumption on a Raspberry Pi, where we demonstrate which methods provide the best perplexity-power consumption operating point. At one operating point, one of the techniques is able to provide energy savings of 40% over the state of the art with only a 17% relative increase in perplexity.

研究动机与目标

  • 探索移动设备上神经语言模型(NLMs)的精度-效率权衡空间,因为更高精度通常导致更高的功耗。
  • 通过可在每次推理请求时调节的剪枝技术,实现在运行时对模型效率和精度的自适应控制。
  • 在真实移动硬件(树莓派)上测量能耗和延迟,而非依赖理论的 FLOP 估算。
  • 提出一种轻量级方法,通过极低的额外内存开销(单秩权重更新)恢复部分剪枝导致的困惑度损失。
  • 在困惑度和能效两个维度上,对多种剪枝策略(如随机剪枝、滤波器范数剪枝、平均激活剪枝、$L_0$ 正则化)进行基准测试与比较。

提出的方法

  • 对预训练的 QRNN 应用推理时剪枝,实现在部署过程中动态调节模型复杂度。
  • 采用四种剪枝策略:随机滤波器剪枝、滤波器范数剪枝、平均激活剪枝和 $L_0$ 正则化。
  • 采用单秩权重更新技术,在极低内存开销(WT103 模型下小于 120 KB)下恢复性能损失。
  • 在树莓派上测量能耗和延迟,以评估实际效率,并将 FLOPs 与功耗和延迟进行关联分析。
  • 通过绑定输入层和输出层权重,减少参数数量和内存占用,提升效率。
  • 通过调整相对于未剪枝模型的 FLOP 比例(如 100%、80%、70%、60%、50%),在多个工作点上评估剪枝效果。

实验结果

研究问题

  • RQ1推理时剪枝是否能在移动设备上的神经语言模型中提供可调的精度-效率控制?
  • RQ2在随机剪枝、滤波器范数剪枝、平均激活剪枝和 $L_0$ 正则化剪枝中,哪种策略在困惑度与能效之间实现最佳权衡?
  • RQ3单秩权重更新在几乎不增加内存成本的前提下,能在多大程度上恢复剪枝导致的性能损失?
  • RQ4在移动硬件上,FLOPs 与延迟和能耗之间是否存在强线性关系?
  • RQ5在树莓派上进行的真实世界能耗和延迟测量,能否准确反映神经语言模型在移动部署中的效率?

主要发现

  • $L_0$ 正则化剪枝方法在困惑度-精度权衡方面表现最佳,在 Penn Treebank 和 WikiText-103 数据集上均优于随机剪枝、滤波器范数剪枝和平均激活剪枝。
  • 随机剪枝表现出意外的优异性能,优于滤波器范数剪枝和平均激活剪枝,且在单秩更新后能更有效地恢复困惑度。
  • 在所有评估场景中,滤波器范数剪枝的表现均劣于随机剪枝,表明其在实际应用中并无优于随机剪枝的优势。
  • FLOPs 与延迟及能耗之间存在强线性关系,树莓派上的皮尔逊相关系数 $r^2 = 0.98$。
  • 单秩更新技术仅需额外不到 120 KB 的内存,即可实现性能恢复,因此适用于移动设备部署。
  • 在某一工作点上,该方法相比最先进模型实现 40% 的能耗降低,且困惑度仅增加 17%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。