Skip to main content
QUICK REVIEW

[论文解读] NN-LUT: Neural Approximation of Non-Linear Operations for Efficient Transformer Inference

Joonsang Yu, Junki Park|arXiv (Cornell University)|Dec 3, 2021
Neural Networks and Applications被引用 5
一句话总结

该论文提出 NN-LUT,一种硬件高效框架,通过将非线性操作(如 GELU、Softmax 和 LayerNorm)转换为查表(LUT)形式的神经网络,实现低延迟、低功耗推理。与最先进的基于整数的近似方法相比,该方法在 GLUE 和 SQuAD 基准测试上仅造成可忽略的精度下降,系统速度最高提升 26%,功耗降低 36.4 倍。

ABSTRACT

Non-linear operations such as GELU, Layer normalization, and Softmax are essential yet costly building blocks of Transformer models. Several prior works simplified these operations with look-up tables or integer computations, but such approximations suffer inferior accuracy or considerable hardware cost with long latency. This paper proposes an accurate and hardware-friendly approximation framework for efficient Transformer inference. Our framework employs a simple neural network as a universal approximator with its structure equivalently transformed into a LUT. The proposed framework called NN-LUT can accurately replace all the non-linear operations in popular BERT models with significant reductions in area, power consumption, and latency.

研究动机与目标

  • 解决 Transformer 模型推理过程中非线性操作(如 GELU、Softmax、LayerNorm)带来的高硬件开销与高延迟问题。
  • 开发一种通用且硬件友好的近似框架,避免复杂数据通路与高精度算术运算。
  • 实现对预训练 BERT 模型中非线性操作的即插即用替换,无需重新训练或微调。
  • 在保持模型精度的同时,降低神经处理单元(NPUs)的面积、功耗与延迟。
  • 通过集成到现有 NPU 架构中,展示系统级性能提升。

提出的方法

  • 训练一个单隐藏层 ReLU 神经网络作为非线性函数的通用近似器,随后通过数学变换转化为等效的 LUT 实现形式。
  • LUT 按操作类型(如 GELU、Softmax)独立更新,无需更改硬件,支持在不同非线性函数间复用。
  • 采用通用训练策略,以最小化在广泛输入范围内的近似误差。
  • 通过输入缩放扩展 LUT 近似的动态范围,提升在宽输入域上的精度。
  • 提出一种无需数据集的校准方法,可在不依赖标注数据或完整模型微调的情况下优化 LUT 精度。
  • 采用 7-nm 工艺进行硬件综合,与最先进的纯整数实现方法对比面积、功耗与延迟。

实验结果

研究问题

  • RQ1能否在不造成精度损失的前提下,将神经网络有效转换为 Transformer 中非线性运算的 LUT 近似形式?
  • RQ2与现有基于整数的近似方法相比,所提出的 NN-LUT 框架在硬件效率(面积、功耗、延迟)方面表现如何?
  • RQ3NN-LUT 是否可作为 GELU、Softmax 和 LayerNorm 在 BERT 与 MobileBERT 模型中的即插即用替代方案,且精度下降可忽略?
  • RQ4将 NN-LUT 集成到现有 NPU 架构中,可实现哪些系统级性能提升?
  • RQ5LUT 近似是否可在无需标注数据集或完整模型微调的情况下完成校准?

主要发现

  • 与最先进的基于整数的近似方法(I-BERT)相比,NN-LUT 在非线性运算上实现了 2.63× 的面积缩减与 36.4× 的功耗降低。
  • 与 I-BERT 相比,NN-LUT 将关键路径延迟降低了 3.93×,显著降低了延迟。
  • 在集成 NPU 上的 RoBERTa 推理中,NN-LUT 框架实现了高达 26% 的系统级速度提升,主要得益于非线性运算执行的优化。
  • 在 GLUE 与 SQuAD 基准测试中,NN-LUT 与原始模型保持近乎相同的模型精度,精度下降可忽略。
  • 无数据集校准方法有效提升了 LUT 精度,且无需依赖标注数据或完整模型微调。
  • 硬件综合结果表明,NN-LUT 的 LUT 架构设计高度高效,且与已支持 LUT 的现有 NPU 架构完全兼容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。