[论文解读] Structured Weight Matrices-Based Hardware Accelerators in Deep Neural Networks: FPGAs and ASICs
该论文提出基于块循环矩阵的结构化权重重矩阵(SWM),以实现深度神经网络在FPGA和ASIC上的高效压缩。通过将计算复杂度从O(n²)降低至O(n log n),存储复杂度从O(n²)降低至O(n),该方法在FPGA上实现了最高152倍的性能提升和72倍的能效增益,在LSTM模型上实现21倍加速和33.5倍能效提升,并在40nm ASIC设计中实现8.08×10⁶张图像/焦耳的能效表现。
Both industry and academia have extensively investigated hardware accelerations. In this work, to address the increasing demands in computational capability and memory requirement, we propose structured weight matrices (SWM)-based compression techniques for both \emph{field programmable gate array} (FPGA) and \emph{application-specific integrated circuit} (ASIC) implementations. In algorithm part, SWM-based framework adopts block-circulant matrices to achieve a fine-grained tradeoff between accuracy and compression ratio. The SWM-based technique can reduce computational complexity from O($n^2$) to O($n\log n$) and storage complexity from O($n^2$) to O($n$) for each layer and both training and inference phases. For FPGA implementations on deep convolutional neural networks (DCNNs), we achieve at least 152X and 72X improvement in performance and energy efficiency, respectively using the SWM-based framework, compared with the baseline of IBM TrueNorth processor under same accuracy constraints using the data set of MNIST, SVHN, and CIFAR-10. For FPGA implementations on long short term memory (LSTM) networks, the proposed SWM-based LSTM can achieve up to 21X enhancement in performance and 33.5X gains in energy efficiency compared with the baseline accelerator. For ASIC implementations, the SWM-based ASIC design exhibits impressive advantages in terms of power, throughput, and energy efficiency. Experimental results indicate that this method is greatly suitable for applying DNNs onto both FPGAs and mobile/IoT devices.
研究动机与目标
- 应对资源受限环境中大规模深度神经网络(DNN)日益增长的计算与内存需求。
- 克服现有模型压缩技术(如稀疏化和低秩近似)带来的不规则性与训练复杂度增加的局限性。
- 实现在FPGA和ASIC上面向移动与物联网设备的高性能、高能效DNN推理。
- 通过结构化权重重矩阵设计,实现模型精度与压缩率之间的细粒度权衡。
- 构建一个适用于DNN中全连接层与卷积层的数学严谨框架。
提出的方法
- 采用块循环矩阵作为结构化权重重矩阵(SWM),以替代DNN层中的密集权重重矩阵。
- 利用快速傅里叶变换(FFT)实现高效的矩阵-向量乘法,将复杂度从O(n²)降低至O(n log n)。
- 对全连接层与卷积层应用权重重矩阵变换,在保持模型精度的同时实现压缩。
- 在ASIC设计中使用64点FFT模块处理64维向量,实现对结构化矩阵的高效计算。
- 在FPGA(XCKU060,Virtex-7)与ASIC(SMIC 40nm)平台上实现SWM设计,完成端到端评估。
- 在输出层保留原始权重重结构以维持精度,而将所有前序层转换为块循环形式。
实验结果
研究问题
- RQ1基于块循环矩阵的结构化权重重矩阵(SWM)是否能在保持高模型精度的同时实现高压缩率?
- RQ2SWM设计在全连接层与卷积层中能在多大程度上降低计算与存储复杂度?
- RQ3与IBM TrueNorth和ESE等先进基线相比,SWM加速器在FPGA平台上的性能与能效表现如何?
- RQ4SWM设计在ASIC实现中为移动与物联网应用带来的性能与能效增益是多少?
- RQ5SWM框架能否在CNN与RNN(如LSTM)上有效应用,并实现最小的精度损失?
主要发现
- 在FPGA平台上,SWM框架在MNIST、SVHN和CIFAR-10数据集上,于相似精度约束下,相较IBM TrueNorth实现至少152倍性能提升与72倍能效增益。
- 对于LSTM网络,所提出的SWM设计在AMD-7v3 FPGA上相较ESE加速器实现最高21倍加速与33.5倍能效增益。
- 采用SMIC 40nm工艺的ASIC实现达到1.14×10⁶张图像/秒吞吐量,功耗0.14W,能效达8.08×10⁶张图像/焦耳。
- SWM设计在LSTM2(块大小8)上仅造成0.32%的相对PER退化,在LSTM1(块大小16)上为1.23%。
- 该方法将每层的存储复杂度从O(n²)降低至O(n),计算复杂度从O(n²)降低至O(n log n),支持在边缘设备上的可扩展部署。
- 能效增益甚至高于性能增益,主要得益于功耗降低——尤其值得注意的是,XCKU060 FPGA采用比Virtex-7更先进的20nm工艺。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。