[论文解读] Term Revealing: Furthering Quantization at Run Time on Quantized DNNs
该论文提出了一种运行时量化技术——术语揭示(Term Revealing, TR),通过动态选择分组权重和激活中的最大2的幂次项,进一步降低已量化深度神经网络(DNN)的计算量。通过采用基于分组的选择机制,并利用HESE编码实现符号数字表示,TR在保持模型精度的同时,使推理计算量相比传统量化技术降低3–10倍,FPGA实现结果表明延迟降低至多7.8倍,能效提升达4.3倍。
We present a novel technique, called Term Revealing (TR), for furthering quantization at run time for improved performance of Deep Neural Networks (DNNs) already quantized with conventional quantization methods. TR operates on power-of-two terms in binary expressions of values. In computing a dot-product computation, TR dynamically selects a fixed number of largest terms to use from the values of the two vectors in the dot product. By exploiting normal-like weight and data distributions typically present in DNNs, TR has a minimal impact on DNN model performance (i.e., accuracy or perplexity). We use TR to facilitate tightly synchronized processor arrays, such as systolic arrays, for efficient parallel processing. We show an FPGA implementation that can use a small number of control bits to switch between conventional quantization and TR-enabled quantization with a negligible delay. To enhance TR efficiency further, we use a signed digit representation (SDR), as opposed to classic binary encoding with only nonnegative power-of-two terms. To perform conversion from binary to SDR, we develop an efficient encoding method called HESE (Hybrid Encoding for Signed Expressions) that can be performed in one pass looking at only two bits at a time. We evaluate TR with HESE encoded values on an MLP for MNIST, multiple CNNs for ImageNet, and an LSTM for Wikitext-2, and show significant reductions in inference computations (between 3-10x) compared to conventional quantization for the same level of model performance.
研究动机与目标
- 在不牺牲模型精度的前提下,实现对已通过传统方法量化过的DNN的进一步计算量缩减。
- 解决传统量化技术的局限性,即在不重新训练或导致显著精度损失的情况下无法进一步降低计算量。
- 设计一种可重构硬件系统,支持传统量化与运行时TR量化,且控制开销极低。
- 开发一种高效的符号数字表示(SDR)编码方法,以最小化数值表示中的术语数量,从而提升计算节省效果。
提出的方法
- TR在量化权重和激活的2的幂次项(二进制或符号数字表示)上运行,仅选择每组值中的最大项。
- TR采用基于分组的方法,每组$g$个值中仅选择固定数量的最高项(组预算$k$)来计算点积,从而减少术语对乘法的次数。
- HESE(符号表达式混合编码)方法通过单次遍历将标准二进制表示转换为最短长度的符号数字表示(SDR),每次仅检查两位。
- 提出了一种tMAC(术语乘累加)硬件设计,采用流水线阵列架构并结合位串行系数累加,实现面积小且高度规则的结构。
- FPGA系统仅使用少量控制位即可在传统量化与TR增强量化之间实现运行时重构,支持动态切换且延迟可忽略。
- 该方法利用DNN权重和激活的近似正态分布特性,即使在激进的术语剪枝下也能确保最小精度损失。
实验结果
研究问题
- RQ1是否可以在不降低模型性能的前提下,对已量化DNN在运行时进一步进行量化?
- RQ2基于分组的术语选择如何在保持精度的同时提升DNN推理的计算效率?
- RQ3使用术语数量最少的符号数字表示(SDR)对推理计算量和硬件效率有何影响?
- RQ4TR与传统量化相比,在多种DNN架构中可将计算成本(如术语对乘法)降低多少?
- RQ5单一FPGA硬件设计能否以极低的重构开销高效支持传统量化与TR增强量化?
主要发现
- TR在保持相同模型精度的前提下,使MLP、CNN和LSTM的推理计算量相比传统量化降低3–10倍。
- FPGA实现相比传统量化(QT)在相同硬件上实现了平均处理延迟降低7.8倍,能效提升4.3倍。
- 在ImageNet上的ResNet-18中,TR系统实现了69.48%的top-1精度,25.22帧/焦耳的能效,以及7.21ms的延迟,优于其他基于FPGA的加速器在精度与效率方面的表现。
- 采用组大小$g=8$,并针对不同模型调优组预算$k$(如LSTM的$k=20$,VGG-16的$k=8$),TR使模型性能与QT设置的精度差异控制在0.15%以内。
- HESE编码通过单次遍历、两位前瞻转换,实现了最短长度的SDR,减少了数值表示中的术语数量,从而降低了计算成本。
- 可重构FPGA系统仅需少量控制位即可在传统量化与TR增强量化之间切换,实现了高效的运行时适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。