Skip to main content
QUICK REVIEW

[论文解读] Adaptive Block Floating-Point for Analog Deep Learning Hardware

Ayon Basumallik, Darius Bunandar|arXiv (Cornell University)|May 12, 2022
Analog and Mixed-Signal Circuit Design被引用 5
一句话总结

本文提出带有增益的自适应块浮点(ABFP),以在低精度模拟混合信号(AMS)硬件上实现高精度模拟深度学习推理。通过动态缩放矩阵块并应用放大,ABFP 在不增加 ADC 位宽的情况下减少了量化误差,在 MLPerf™ 基准测试中相比 float32 的精度损失低于 1%,即使仅使用 8 位 ADC 亦可实现。

ABSTRACT

Analog mixed-signal (AMS) devices promise faster, more energy-efficient deep neural network (DNN) inference than their digital counterparts. However, recent studies show that DNNs on AMS devices with fixed-point numbers can incur an accuracy penalty because of precision loss. To mitigate this penalty, we present a novel AMS-compatible adaptive block floating-point (ABFP) number representation. We also introduce amplification (or gain) as a method for increasing the accuracy of the number representation without increasing the bit precision of the output. We evaluate the effectiveness of ABFP on the DNNs in the MLPerf datacenter inference benchmark -- realizing less than $1\%$ loss in accuracy compared to FLOAT32. We also propose a novel method of finetuning for AMS devices, Differential Noise Finetuning (DNF), which samples device noise to speed up finetuning compared to conventional Quantization-Aware Training.

研究动机与目标

  • 解决由于在深度神经网络(DNN)推理中使用低精度定点表示而导致的模拟混合信号(AMS)硬件中精度下降的问题。
  • 在不牺牲模型精度的前提下降低对 ADC 位宽的需求,从而降低基于 AMS 的 DNN 加速器的能耗。
  • 开发一种新型数值表示方法和微调方法,即使在硬件引入的噪声和量化误差下也能保持高模型质量。
  • 证明 ABFP 搭配增益可在硬件开销和能耗极低的情况下实现 AMS 设备上的高精度 DNN 推理。

提出的方法

  • 提出自适应块浮点(ABFP),一种数值表示方法,通过使用共享指数动态缩放输入向量,实现对分块矩阵乘法中输入的归一化。
  • 引入放大(增益)机制,以在不增加输出位宽的情况下提升有效精度,改善动态范围和精度。
  • 将 ABFP 应用于矩阵乘法块,其中权重和激活在模拟计算前被缩放,输出在累加后进行去归一化。
  • 采用一种新型微调方法——差分噪声微调(DNF),在训练过程中采样实际器件噪声,以加速收敛并提高鲁棒性。
  • 结合量化感知训练(QAT)与 DNF 对 DNN 进行微调,使其在 ABFP 量化和硬件噪声后能够恢复精度。
  • 将 ABFP 的缩放因子限制为仅指数部分(无尾数),以降低计算开销,通过牺牲极小精度换取效率提升。

实验结果

研究问题

  • RQ1ABFP 搭配增益是否能显著降低 ADC 位宽需求,同时在 AMS 硬件上实现高精度 DNN 推理?
  • RQ2与定点表示相比,ABFP 在大规模 DNN 上的精度和能效表现如何?
  • RQ3在噪声较大的 AMS 设备上,差分噪声微调(DNF)是否比传统量化感知训练(QAT)更有效地加速收敛并恢复模型质量?
  • RQ4输出维度和决策边界复杂度对 DNN 在 ABFP 量化和硬件噪声下的鲁棒性有何影响?
  • RQ5ABFP 与增益的结合相比以往的 AMS 设计,如何降低高精度推理的能耗?

主要发现

  • ABFP 搭配增益可在仅使用 8 位 ADC 的 AMS 硬件上实现 DNN 推理,在所有六个 MLPerf™ 数据中心推理基准测试中,相比 float32 的精度损失低于 1%。
  • 与先前工作(Rekhi 等,2021)中最佳配置相比,该方法将能耗降低了约 2.8 倍,主要得益于 ADC 位宽从 12.5 位降低至 8 位。
  • 对于 ResNet50,降低 ADC 位数带来的能耗节省(2^4.5×)超过了应用 8 倍增益的开销,最终实现 2.8 倍的净能耗降低。
  • DNF 通过采样实际器件噪声显著加速了微调过程,在收敛速度和精度恢复方面优于传统 QAT。
  • 输出类别较少的 DNN(如 2 类)比高维输出(如 1000 类)对 ABFP 量化和噪声更具鲁棒性,表明模型复杂度会影响鲁棒性。
  • ABFP 转换的计算开销可通过大尺寸矩阵块分摊,与低精度 ADC 带来的能耗节省相比可忽略不计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。