Skip to main content
QUICK REVIEW

[论文解读] Applying the Residue Number System to Network Inference

Mohamed R. Abdelhamid, Skanda Koppula|arXiv (Cornell University)|Dec 13, 2017
Cryptography and Residue Arithmetic参考文献 4被引用 10
一句话总结

本文提出使用剩余数系统(RNS)通过用基于RNS的乘法和加法替代标准算术,以加速神经网络推理,使乘法器的能耗降低高达48%,并实现在低功耗硬件上的能效推理。该方法利用RNS的并行性与高效的模数算术,实验结果表明在6位整数约束下仍具备可行的精度,且全连接层的能耗节省达到有利的盈亏平衡点。

ABSTRACT

This work explores the lesser studied objective of optimizing the multiply-and-accumulates executed during evaluation of the network. In particular, we propose using the Residue Number System (RNS) as the internal number representation across all layer evaluations, allowing us to explore usage of the more power-efficient RNS multipliers and adders. Using results from simulation of our RNS arithmetic block implementations, we show theoretical power advantages of using RNS for an end-to-end evaluator.

研究动机与目标

  • 探索剩余数系统(RNS)作为神经网络推理中替代数表示方法的潜力,尤其关注能效提升。
  • 通过用基于RNS的计算替代标准32位算术,减少乘加(MAC)操作的能耗与面积开销——这是卷积神经网络推理中的关键瓶颈。
  • 通过在模数范围内使用定点权值和激活值训练网络,评估在RNS约束下保持网络精度的可行性。
  • 确定基于RNS的推理相较于传统推理更具能效的盈亏平衡点,尤其针对全连接层与卷积层。
  • 使用65nm CMOS工艺,在Verilog中实现并分析RNS专用硬件模块(加法器、乘法器、ReLU与比较器模块)的功耗、面积与延迟。

提出的方法

  • 采用四元模数集{2^7−1, 2^7+1, 2^8−1, 2^8+1}表示RNS中的整数,实现28位等效范围,使用32位存储空间,且模数两两互质,确保唯一表示。
  • RNS算术按元素进行:加法与乘法分别模每个独立模数计算,利用优化的RNS加法器与乘法器架构,实现并行且低功耗计算。
  • 基于RNS差值的奇偶校验设计比较模块,以支持ReLU非线性,采用简化的“半比较器”实现M/2阈值判断,降低逻辑复杂度。
  • ReLU与比较器模块通过组合逻辑实现,采用改进的现有RNS比较技术,预计算奇偶值以提升效率。
  • 硬件模块(加法器、乘法器、转换器、ReLU与比较器)使用Bluespec/SystemVerilog设计,并通过65nm CMOS工艺综合,估算功耗、面积与延迟。
  • 通过在SVHN数据集上使用6位定点权值与激活值训练一个6层CNN/全连接网络,模拟完整网络推理流程,将RNS约束下的精度与全精度及32位整数基线进行对比。

实验结果

研究问题

  • RQ1基于RNS的算术能否降低神经网络推理中的能耗,特别是在乘加(MAC)单元中?
  • RQ2当权值与激活值被限制在适合RNS表示的模数范围内定点整数时,精度会下降多少?
  • RQ3在何种层大小或网络配置下,基于RNS的MAC单元带来的能耗节省能超过RNS专用ReLU与比较器操作的开销?
  • RQ4在标准CMOS工艺中,RNS硬件模块的功耗、面积与延迟与32位对应模块相比如何?
  • RQ5是否可行仅使用RNS算术完成端到端推理,包括激活函数与输出选择,而无需转换回标准二进制?

主要发现

  • RNS乘法器功耗为1.56 mW,相比32位乘法器(3.04 mW)降低48.7%,且具有95.4 ps的正时序余量,支持更高时钟频率。
  • RNS加法器功耗为1.18 mW,略高于32位加法器(1.05 mW),但工作频率相同,且时序余量更优。
  • 在SVHN数据集上,采用RNS约束的(6,6)-FP网络测试误差为6.69%,相比(32,32)-FP基线(3.95%)增加2.74%,表明在RNS约束下存在适度精度下降。
  • (6,6)-INT网络测试误差为7.07%,相比(32,32)-INT基线(4.54%)下降2.53%,表明整数量化可能引入额外的训练不稳定性。
  • 盈亏平衡分析表明,即使在小型全连接层中,基于RNS的推理也具有能效优势,当输入大小X > 0.98时,RNS MAC的能耗节省超过ReLU操作的开销。
  • 能耗节省在各类层型中均具鲁棒性,当X替换为滤波器输出尺寸(C_in × K_X × K_Y)时,该盈亏平衡条件同样适用于卷积层。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。