Skip to main content
QUICK REVIEW

[论文解读] NullaNet: Training Deep Neural Networks for Reduced-Memory-Access Inference

Mahdi Nazemi, Ghasem Pasandi|arXiv (Cornell University)|Jul 23, 2018
Advanced Neural Network Applications被引用 12
一句话总结

NullaNet 提出了一种新颖的训练方法,通过将深度神经网络层的激活值约束为二值,将其转化为布尔逻辑函数,从而实现无需内存的推理,通过逻辑优化减少内存访问。该方法将内存访问减少高达 2,095 倍,计算成本降低 77%,并通过消除浮点运算和 DRAM 访问降低功耗,在 FPGA 上实现高能效,且精度损失极小。

ABSTRACT

Deep neural networks have been successfully deployed in a wide variety of applications including computer vision and speech recognition. However, computational and storage complexity of these models has forced the majority of computations to be performed on high-end computing platforms or on the cloud. To cope with computational and storage complexity of these models, this paper presents a training method that enables a radically different approach for realization of deep neural networks through Boolean logic minimization. The aforementioned realization completely removes the energy-hungry step of accessing memory for obtaining model parameters, consumes about two orders of magnitude fewer computing resources compared to realizations that use floatingpoint operations, and has a substantially lower latency.

研究动机与目标

  • 为解决深度神经网络(DNNs)在移动设备等能效受限平台上的高能耗和高延迟内存访问问题。
  • 通过将 DNN 层重新定义为具有二值激活的布尔函数,消除推理过程中对内存访问的需求。
  • 在不造成显著精度下降的前提下,大幅降低计算和内存资源使用。
  • 通过布尔逻辑优化而非浮点数运算,实现 DNN 的高效硬件实现。
  • 证明在保留全精度权重的同时,可实现极低内存访问和功耗。

提出的方法

  • 训练 DNN 层使其输入和输出激活为二值,将每一层转化为多输入、多输出的布尔函数。
  • 使用离线仿真,提取每个神经元在二值输入下的激活行为真值表。
  • 应用布尔逻辑最小化算法,优化每个神经元的逻辑函数,降低硬件复杂度。
  • 通过技术映射和 FPGA 综合实现优化后的布尔函数,避免使用浮点运算。
  • 采用流水线和并行化技术,在 FPGA 上实现低延迟、高吞吐量的推理。
  • 保留全精度浮点权重和偏置,避免量化带来的精度损失。

实验结果

研究问题

  • RQ1是否可以不访问内存而实现深度神经网络的推理?
  • RQ2布尔逻辑优化在多大程度上能减少 DNN 中的硬件资源使用和延迟?
  • RQ3与量化或二值化网络相比,保留全精度权重对精度的影响如何?
  • RQ4用布尔逻辑替代 MAC 操作后,能带来多大的能效提升和计算节省?
  • RQ5所提出的方法能否在完全消除权重内存访问的同时保持高精度?

主要发现

  • 与 32 位浮点实现相比,NullaNet 在 CNN 中将内存访问减少了高达 2,095 倍,每输入块仅需访问 110 位,而原实现需 28.13 KB。
  • 与全精度基线相比,该方法在全网络中实现了 77% 的内存访问减少和 76% 的 MAC 操作减少。
  • 硬件实现仅消耗 15,990 个 ALMs 和 41.77 mW 功耗,延迟为 14.26 ns,分别达到单精度和半精度 MAC 延迟的 0.41× 和 0.67×。
  • 与标准点积计算相比,使用优化后的 ISFs(蕴含特定函数)时,分类精度仅下降 0.29%;当激活值被量化为二值时,精度下降 0.79%。
  • 该方法实现了无需任何权重内存访问的推理,完全消除了 DRAM 访问的能耗(每比特能耗降低达 13,000 倍)。
  • 与基于浮点数的 DNN 实现相比,该方法将计算资源使用降低了两个数量级,且精度损失极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。