Skip to main content
QUICK REVIEW

[论文解读] Rethinking Numerical Representations for Deep Neural Networks

Parker Hill, Babak Zamirai|arXiv (Cornell University)|Aug 7, 2018
Numerical Methods and Algorithms参考文献 16被引用 7
一句话总结

本文提出了一种新颖的方法,以高效探索深度神经网络(DNN)推理中的自定义精度浮点与定点表示,使 GoogLeNet 和 VGG 等生产级模型在精度损失低于 1% 的情况下实现平均 7.6× 的加速。该方法引入了一种基于最后一层激活的快速搜索技术,用于预测精度,从而在无需全面评估的情况下快速识别最优精度配置。

ABSTRACT

With ever-increasing computational demand for deep learning, it is critical to investigate the implications of the numeric representation and precision of DNN model weights and activations on computational efficiency. In this work, we explore unconventional narrow-precision floating-point representations as it relates to inference accuracy and efficiency to steer the improved design of future DNN platforms. We show that inference using these custom numeric representations on production-grade DNNs, including GoogLeNet and VGG, achieves an average speedup of 7.6x with less than 1% degradation in inference accuracy relative to a state-of-the-art baseline platform representing the most sophisticated hardware using single-precision floating point. To facilitate the use of such customized precision, we also present a novel technique that drastically reduces the time required to derive the optimal precision configuration.

研究动机与目标

  • 为解决大规模 DNN 推理效率与精度受数值精度影响的关键理解空白。
  • 挑战小网络研究结果可推广至 GoogLeNet 和 VGG 等生产级 DNN 的假设。
  • 开发一种快速、可扩展的方法,用于识别最优自定义精度配置,而无需全面搜索。
  • 证明对于大模型而言,浮点表示优于定点表示,且在保持相同精度时可显著减少位宽需求。
  • 通过精度感知设计,使未来 DNN 硬件平台实现更高性能与能效。

提出的方法

  • 作者提出一种预测模型,利用 DNN 最后一层的激活来估计不同精度配置下的精度,从而减少对完整推理运行的需求。
  • 该模型通过在多个 DNN(如 LeNet、CIFARNET)上使用交叉验证进行训练,以确保在不同网络架构间的泛化能力。
  • 采用两步优化流程,每轮搜索仅评估两个精度配置,实现与全面搜索相当的结果,但速度提升 170×。
  • 该方法根据预测精度动态调整精度设置,确保在最小性能损失下达到目标精度(如 99%)。
  • 该技术在 GoogLeNet 和 VGG 等大型 DNN 上进行了验证,加速效果在自定义加速器架构上测量。
  • 系统性地评估了浮点与定点表示在广泛的设计空间中,通过调节尾数与指数位宽或整数/小数部分位宽,实现最优权衡。

实验结果

研究问题

  • RQ1DNN 推理的精度需求是否在不同网络架构间具有普适性,尤其是从小型模型推广到大型模型?
  • RQ2在 GoogLeNet 和 VGG 等大规模 DNN 上,定点与浮点表示在精度与效率方面有何对比?
  • RQ3基于最后一层激活的快速预测模型能否在无需完整推理评估的情况下,准确识别最优精度配置?
  • RQ4在生产级 DNN 上,为维持高推理精度,定点与浮点表示所需的最小精度是多少?
  • RQ5自定义精度设计在不牺牲精度的前提下,能在多大程度上提升推理速度?

主要发现

  • GoogLeNet 在定点表示下需要超过 40 位才能达到可接受的精度,远高于小型网络研究中的假设。
  • 17 位浮点表示可实现与单精度浮点相当的精度,同时显著减少硬件面积与功耗。
  • 所提出的搜索方法实现与全面搜索等效的结果,但将搜索时间减少 170×,每轮仅评估两个配置。
  • 在 GoogLeNet、VGG 及其他大型 DNN 上,平均推理加速达 7.6×,精度损失低于 1%。
  • 对于大模型而言,浮点表示比定点更高效,因其在保持精度的同时可显著减少位宽需求。
  • 预测模型与实际精度的相关系数达 0.96,可实现高可靠性的精度配置选择,且计算成本极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。