[论文解读] NullaNet: Training Deep Neural Networks for Reduced-Memory-Access Inference
NullaNet 提出了一种新颖的训练方法,通过将深度神经网络层的激活值约束为二值,将其转化为布尔逻辑函数,从而实现无需内存的推理,通过逻辑优化减少内存访问。该方法将内存访问减少高达 2,095 倍,计算成本降低 77%,并通过消除浮点运算和 DRAM 访问降低功耗,在 FPGA 上实现高能效,且精度损失极小。
Deep neural networks have been successfully deployed in a wide variety of applications including computer vision and speech recognition. However, computational and storage complexity of these models has forced the majority of computations to be performed on high-end computing platforms or on the cloud. To cope with computational and storage complexity of these models, this paper presents a training method that enables a radically different approach for realization of deep neural networks through Boolean logic minimization. The aforementioned realization completely removes the energy-hungry step of accessing memory for obtaining model parameters, consumes about two orders of magnitude fewer computing resources compared to realizations that use floatingpoint operations, and has a substantially lower latency.
研究动机与目标
- 为解决深度神经网络(DNNs)在移动设备等能效受限平台上的高能耗和高延迟内存访问问题。
- 通过将 DNN 层重新定义为具有二值激活的布尔函数,消除推理过程中对内存访问的需求。
- 在不造成显著精度下降的前提下,大幅降低计算和内存资源使用。
- 通过布尔逻辑优化而非浮点数运算,实现 DNN 的高效硬件实现。
- 证明在保留全精度权重的同时,可实现极低内存访问和功耗。
提出的方法
- 训练 DNN 层使其输入和输出激活为二值,将每一层转化为多输入、多输出的布尔函数。
- 使用离线仿真,提取每个神经元在二值输入下的激活行为真值表。
- 应用布尔逻辑最小化算法,优化每个神经元的逻辑函数,降低硬件复杂度。
- 通过技术映射和 FPGA 综合实现优化后的布尔函数,避免使用浮点运算。
- 采用流水线和并行化技术,在 FPGA 上实现低延迟、高吞吐量的推理。
- 保留全精度浮点权重和偏置,避免量化带来的精度损失。
实验结果
研究问题
- RQ1是否可以不访问内存而实现深度神经网络的推理?
- RQ2布尔逻辑优化在多大程度上能减少 DNN 中的硬件资源使用和延迟?
- RQ3与量化或二值化网络相比,保留全精度权重对精度的影响如何?
- RQ4用布尔逻辑替代 MAC 操作后,能带来多大的能效提升和计算节省?
- RQ5所提出的方法能否在完全消除权重内存访问的同时保持高精度?
主要发现
- 与 32 位浮点实现相比,NullaNet 在 CNN 中将内存访问减少了高达 2,095 倍,每输入块仅需访问 110 位,而原实现需 28.13 KB。
- 与全精度基线相比,该方法在全网络中实现了 77% 的内存访问减少和 76% 的 MAC 操作减少。
- 硬件实现仅消耗 15,990 个 ALMs 和 41.77 mW 功耗,延迟为 14.26 ns,分别达到单精度和半精度 MAC 延迟的 0.41× 和 0.67×。
- 与标准点积计算相比,使用优化后的 ISFs(蕴含特定函数)时,分类精度仅下降 0.29%;当激活值被量化为二值时,精度下降 0.79%。
- 该方法实现了无需任何权重内存访问的推理,完全消除了 DRAM 访问的能耗(每比特能耗降低达 13,000 倍)。
- 与基于浮点数的 DNN 实现相比,该方法将计算资源使用降低了两个数量级,且精度损失极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。