[论文解读] WrapNet: Neural Net Inference with Ultra-Low-Resolution Arithmetic
WrapNet 通过引入可微分的循环激活函数和溢出惩罚正则化器,实现了使用超低精度(8位)累加器的神经网络推理,使网络对整数溢出具有鲁棒性。该方法在软件中实现最高 2.4 倍的加速,在专用硬件中实现超过 5 倍的能效提升,同时以极小的精度损失达到 32 位精度的准确率。
Low-resolution neural networks represent both weights and activations with few bits, drastically reducing the multiplication complexity. Nonetheless, these products are accumulated using high-resolution (typically 32-bit) additions, an operation that dominates the arithmetic complexity of inference when using extreme quantization (e.g., binary weights). To further optimize inference, we propose a method that adapts neural networks to use low-resolution (8-bit) additions in the accumulators, achieving classification accuracy comparable to their 32-bit counterparts. We achieve resilience to low-resolution accumulation by inserting a cyclic activation layer, as well as an overflow penalty regularizer. We demonstrate the efficacy of our approach on both software and hardware platforms.
研究动机与目标
- 为解决量化神经网络中高精度(32 位)累加的瓶颈问题,尽管权重和激活值为低精度,但累加操作仍主导算术成本。
- 在软件和专用硬件中实现高效推理,使用超低分辨率(8 位)累加器,降低功耗和面积开销。
- 通过使网络对溢出效应具有鲁棒性,即使在低精度累加器中发生整数溢出,也能保持高分类准确率。
- 设计支持通用处理器上 8 位操作位打包的训练与推理流水线,即使无向量指令也适用。
- 在软件优化内核和专用硬件加速器中,通过使用 8 位累加器,展示显著的性能与效率提升。
提出的方法
- 引入周期等于可表示整数范围(max - min)的可微分循环激活函数,使神经网络在累加过程中对溢出保持鲁棒。
- 在训练中应用溢出惩罚正则化器,以最小化位打包整数计算中进位伪影的影响。
- 使用位打包技术将多个 8 位整数存储于一个 32 位寄存器中,实现在通用处理器上的并行操作。
- 修改 Gemmlowp 库以支持 8 位累加器,使具有向量指令的处理器能够高效进行软件推理。
- 在 28nm CMOS 工艺中设计并评估一个具有 8 位累加器的专用 MAC 单元,与 32 位累加器设计对比面积、周期时间和能效。
- 实施一种硬件感知的训练策略,使网络行为适应低精度累加,确保在溢出情况下仍能保持准确率。
实验结果
研究问题
- RQ1在推理过程中,使用 8 位累加器而非 32 位累加器时,神经网络能否在整数溢出的情况下仍保持高准确率?
- RQ2当缺乏向量指令时,如何高效且准确地实现 8 位整数的位打包?
- RQ3在专用硬件加速器中,将累加器位宽从 32 位降低到 8 位,对周期时间、面积和能效的影响如何?
- RQ4可微分的循环激活函数能否有效使网络对低精度累加器中的溢出具有鲁棒性?
- RQ5低精度累加在软件和硬件平台中,能在多大程度上提升推理速度和效率?
主要发现
- 在支持向量指令的处理器上,使用修改后的 Gemmlowp 内核和 8 位累加器,WrapNet 在软件推理中实现最高 2.4 倍加速。
- 在无向量指令的环境下,通过溢出惩罚正则化器实现进位位缓解的位打包技术,在 ResNet-18 卷积层上实现 2.8 倍至 4.3 倍的加速。
- 在定制的 28nm CMOS 硬件中,将累加器分辨率从 32 位降低到 8 位,使累加器组件的面积和功耗分别减少 8 倍以上和 5 倍以上。
- 与 32 位对应设计相比,8 位累加器设计使整个 MAC 单元的能效最高降低 3 倍,面积效率最高降低 5 倍。
- 循环激活函数使网络在极端量化条件下仍能保持与 32 位精度模型相当的分类准确率。
- 硬件分析表明,累加器而非乘法器是周期时间的主要瓶颈,因此低精度累加对性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。