[论文解读] Tartan: Accelerating Fully-Connected and Convolutional Layers in Deep Learning Networks by Exploiting Numerical Precision Variability
Tartan (TRT) 是一种硬件加速器,通过为每层动态调整数值精度,并使用混合位串行/并行处理单元,加速深度神经网络中的全连接层和卷积层。与最先进的位并行加速器相比,其推理速度最高提升1.90倍,能效提升1.17倍,若以牺牲1%的精度换取性能,则性能提升进一步增加。
Tartan (TRT), a hardware accelerator for inference with Deep Neural Networks (DNNs), is presented and evaluated on Convolutional Neural Networks. TRT exploits the variable per layer precision requirements of DNNs to deliver execution time that is proportional to the precision p in bits used per layer for convolutional and fully-connected layers. Prior art has demonstrated an accelerator with the same execution performance only for convolutional layers. Experiments on image classification CNNs show that on average across all networks studied, TRT outperforms a state-of-the-art bit-parallel accelerator by 1:90x without any loss in accuracy while it is 1:17x more energy efficient. TRT requires no network retraining while it enables trading off accuracy for additional improvements in execution performance and energy efficiency. For example, if a 1% relative loss in accuracy is acceptable, TRT is on average 2:04x faster and 1:25x more energy efficient than a conventional bit-parallel accelerator. A Tartan configuration that processes 2-bits at time, requires less area than the 1-bit configuration, improves efficiency to 1:24x over the bit-parallel baseline while being 73% faster for convolutional layers and 60% faster for fully-connected layers is also presented.
研究动机与目标
- 解决现有 DNN 加速器在无论各层精度需求如何均使用固定精度处理所导致的性能和能效限制。
- 通过根据每层使用的精度(以位为单位)动态调整执行时间,实现性能和能效的提升。
- 扩展先前的位串行加速器工作,高效支持卷积层和全连接层,克服全连接层中能量效率低下的问题。
- 提供一种硬件解决方案,可在不重新训练网络的情况下实现实时精度、性能和能效之间的权衡。
- 保持与标准内存接口的兼容性,同时支持高效的内存访问,同时实现可变精度计算。
提出的方法
- 设计一种混合位串行/并行功能单元架构,支持权重和激活值的1位和多精度处理。
- 使用级联的串行内积(SIP)单元,实现输出计算的分片处理,减少小层的跨通道不平衡,提高资源利用率。
- 实施一种基于 Judd 等人 [11] 提出的敏感性分析的方法,以确定每层权重和激活值的最优精度。
- 保持与位并行加速器相同的内存接口和引脚数量,以确保兼容性并避免增加外部带宽。
- 将执行时间与精度 p 成反比缩放,对卷积层和全连接层,相对于16位基线,实现理想的加速比 16/p。
- 支持推理期间的动态精度调整,实现实时精度、性能和能效之间的权衡。
实验结果
研究问题
- RQ1硬件加速器能否通过利用 DNN 中不同层的可变精度需求,实现性能和能效的提升?
- RQ2如何有效将位串行处理扩展到全连接层,以克服先前位串行设计中观察到的能量效率低下问题?
- RQ3在不损害模型精度的前提下,动态精度缩放能在多大程度上减少推理时间和能耗?
- RQ4单一加速器架构能否高效处理具有不同精度需求的卷积层和全连接层,同时保持高内存带宽和低面积开销?
- RQ5在 DNN 推理中,以少量精度损失换取更高速度和效率时,性能和能效的提升程度如何?
主要发现
- 在图像分类卷积神经网络的所有层中,TRT 相较于最先进的位并行加速器(DaDN),平均实现1.90倍的加速和1.17倍的能效提升。
- 对于全连接层,TRT 相较于 DaDN 实现1.61倍的加速和1.06倍的能效提升。
- 对于卷积层,TRT 相较于 DaDN 实现1.91倍的加速和1.18倍的能效提升。
- 在相对精度损失1%的情况下,TRT 的推理速度比位并行基线快2.04倍,能效提升1.25倍。
- 2位 TRT 配置相比1位基线,卷积层的处理速度提升73%,全连接层提升60%,同时能效提高1.24倍。
- TRT 支持动态精度缩放,可直接转化为性能和能效节省,为推理工作负载提供了新的自适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。