Skip to main content
QUICK REVIEW

[论文解读] Network Pruning for Low-Rank Binary Indexing

Dongsoo Lee, Se Jung Kwon|arXiv (Cornell University)|May 14, 2019
Neural Networks and Applications参考文献 27被引用 5
一句话总结

本文提出了一种新颖的细粒度网络剪枝方法,通过低秩二值矩阵分解压缩剪枝索引,实现了高倍率压缩与高效、可并行化的推理。通过将二值剪枝掩码分解为两个小型二值矩阵,该方法在AlexNet的全连接层上实现了高达8.2倍的索引压缩率,同时保持了模型精度。

ABSTRACT

Pruning is an efficient model compression technique to remove redundancy in the connectivity of deep neural networks (DNNs). Computations using sparse matrices obtained by pruning parameters, however, exhibit vastly different parallelism depending on the index representation scheme. As a result, fine-grained pruning has not gained much attention due to its irregular index form leading to large memory footprint and low parallelism for convolutions and matrix multiplications. In this paper, we propose a new network pruning technique that generates a low-rank binary index matrix to compress index data while decompressing index data is performed by simple binary matrix multiplication. This proposed compression method finds a particular fine-grained pruning mask that can be decomposed into two binary matrices. We also propose a tile-based factorization technique that not only lowers memory requirements but also enhances compression ratio. Various DNN models can be pruned with much fewer indexes compared to previous sparse matrix formats while maintaining the same pruning rate.

研究动机与目标

  • 为解决因稀疏模式不规则和高索引内存开销导致的细粒度剪枝在硬件上效率低下的问题。
  • 开发一种结构化、规则的索引表示方式,以在稀疏DNN推理中实现高并行性与低内存占用。
  • 通过二值矩阵分解减少索引数据大小,实现细粒度剪枝的实际部署。
  • 在实现显著高于CSR和基于Viterbi的索引格式等现有稀疏矩阵格式压缩率的同时,保持高模型精度。

提出的方法

  • 提出二值矩阵分解(BMF),将剪枝掩码表示为两个低秩二值矩阵的乘积,实现紧凑且规则的索引表示。
  • 采用启发式算法寻找低秩二值分解,以最小化与原始二值剪枝掩码的不匹配位数。
  • 应用基于分块的分解技术,通过分块处理大权重矩阵来降低计算成本并提升压缩率。
  • 在BMF前引入权重重幅缩放(乘以1/(1-S)),以增强剪枝效果,使更多接近零的权重被移除。
  • 通过简单的二值矩阵乘法对索引数据进行解压缩,该操作在现代硬件上高度可并行化。
  • 引入秩控制与分块技术,在不同层之间平衡压缩率、精度与计算成本。

实验结果

研究问题

  • RQ1低秩二值矩阵分解能否在保持模型精度的前提下有效压缩剪枝索引数据?
  • RQ2所提方法是否在压缩率上优于传统稀疏格式(如CSR和基于Viterbi的索引)?
  • RQ3所得索引表示能否在GPU和多线程CPU上实现高效、高度并行化的推理?
  • RQ4分块技术在大型全连接层中对压缩率与计算效率有何影响?
  • RQ5权重重幅缩放对二值矩阵分解在剪枝中的有效性有何影响?

主要发现

  • 在AlexNet的FC5和FC6层上,该方法实现了最高达8.2倍的压缩率,将索引大小从CSR-16bit的10.06 MB降低至812 KB。
  • 在70%剪枝率下的ResNet32上,该方法保持了91.8%的精度,同时实现了3.09倍的压缩率。
  • 在PTB语言模型上,该方法实现了1.82倍的压缩率,仅造成0.6 PPW的性能下降,保持了89.0 PPW的性能。
  • 通过秩控制,该方法可实现理性压缩率(如8.2倍、5.12倍),而基于Viterbi的方法受限于整数倍率。
  • 将FC5和FC6层分别划分为16×8和8×8的分块,可提升压缩率并降低计算成本。
  • 该方法在压缩率与硬件效率方面均优于基于Viterbi的索引,在XOR门与延迟单元数量上需求更少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。