[论文解读] Adaptive Pruning of Neural Language Models for Mobile Devices
本文提出对准循环神经网络(QRNNs)进行自适应剪枝,以实现移动语言建模中的运行时精度-效率权衡调节,通过推理时剪枝技术实现。实验表明,$L_0$ 正则化剪枝在困惑度-精度平衡方面表现最佳,在树莓派上相比最先进模型实现 40% 的能效降低,且困惑度仅增加 17%。
Neural language models (NLMs) exist in an accuracy-efficiency tradeoff space where better perplexity typically comes at the cost of greater computation complexity. In a software keyboard application on mobile devices, this translates into higher power consumption and shorter battery life. This paper represents the first attempt, to our knowledge, in exploring accuracy-efficiency tradeoffs for NLMs. Building on quasi-recurrent neural networks (QRNNs), we apply pruning techniques to provide a "knob" to select different operating points. In addition, we propose a simple technique to recover some perplexity using a negligible amount of memory. Our empirical evaluations consider both perplexity as well as energy consumption on a Raspberry Pi, where we demonstrate which methods provide the best perplexity-power consumption operating point. At one operating point, one of the techniques is able to provide energy savings of 40% over the state of the art with only a 17% relative increase in perplexity.
研究动机与目标
- 探索移动设备上神经语言模型(NLMs)的精度-效率权衡空间,因为更高精度通常导致更高的功耗。
- 通过可在每次推理请求时调节的剪枝技术,实现在运行时对模型效率和精度的自适应控制。
- 在真实移动硬件(树莓派)上测量能耗和延迟,而非依赖理论的 FLOP 估算。
- 提出一种轻量级方法,通过极低的额外内存开销(单秩权重更新)恢复部分剪枝导致的困惑度损失。
- 在困惑度和能效两个维度上,对多种剪枝策略(如随机剪枝、滤波器范数剪枝、平均激活剪枝、$L_0$ 正则化)进行基准测试与比较。
提出的方法
- 对预训练的 QRNN 应用推理时剪枝,实现在部署过程中动态调节模型复杂度。
- 采用四种剪枝策略:随机滤波器剪枝、滤波器范数剪枝、平均激活剪枝和 $L_0$ 正则化。
- 采用单秩权重更新技术,在极低内存开销(WT103 模型下小于 120 KB)下恢复性能损失。
- 在树莓派上测量能耗和延迟,以评估实际效率,并将 FLOPs 与功耗和延迟进行关联分析。
- 通过绑定输入层和输出层权重,减少参数数量和内存占用,提升效率。
- 通过调整相对于未剪枝模型的 FLOP 比例(如 100%、80%、70%、60%、50%),在多个工作点上评估剪枝效果。
实验结果
研究问题
- RQ1推理时剪枝是否能在移动设备上的神经语言模型中提供可调的精度-效率控制?
- RQ2在随机剪枝、滤波器范数剪枝、平均激活剪枝和 $L_0$ 正则化剪枝中,哪种策略在困惑度与能效之间实现最佳权衡?
- RQ3单秩权重更新在几乎不增加内存成本的前提下,能在多大程度上恢复剪枝导致的性能损失?
- RQ4在移动硬件上,FLOPs 与延迟和能耗之间是否存在强线性关系?
- RQ5在树莓派上进行的真实世界能耗和延迟测量,能否准确反映神经语言模型在移动部署中的效率?
主要发现
- $L_0$ 正则化剪枝方法在困惑度-精度权衡方面表现最佳,在 Penn Treebank 和 WikiText-103 数据集上均优于随机剪枝、滤波器范数剪枝和平均激活剪枝。
- 随机剪枝表现出意外的优异性能,优于滤波器范数剪枝和平均激活剪枝,且在单秩更新后能更有效地恢复困惑度。
- 在所有评估场景中,滤波器范数剪枝的表现均劣于随机剪枝,表明其在实际应用中并无优于随机剪枝的优势。
- FLOPs 与延迟及能耗之间存在强线性关系,树莓派上的皮尔逊相关系数 $r^2 = 0.98$。
- 单秩更新技术仅需额外不到 120 KB 的内存,即可实现性能恢复,因此适用于移动设备部署。
- 在某一工作点上,该方法相比最先进模型实现 40% 的能耗降低,且困惑度仅增加 17%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。