Skip to main content
QUICK REVIEW

[논문 리뷰] NN-LUT: Neural Approximation of Non-Linear Operations for Efficient Transformer Inference

Joonsang Yu, Junki Park|arXiv (Cornell University)|2021. 12. 03.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 GELU, Softmax, LayerNorm 등의 비선형 연산을 신경망으로 변환한 Look-up Table(LUT)를 사용하여 BERT 기반 모델에서 비선형 연산을 대체하는 하드웨어 효율적인 프레임워크인 NN-LUT을 제안한다. 이는 저지연, 저전력 추론을 가능하게 하며, 최신 정수 기반 근사 기법 대비 최대 26%의 시스템 성능 향상과 36.4배의 낮은 전력 소비를 달성했으며, GLUE 및 SQuAD 벤치마크에서 정확도 저하가 거의 없이 구현되었다.

ABSTRACT

Non-linear operations such as GELU, Layer normalization, and Softmax are essential yet costly building blocks of Transformer models. Several prior works simplified these operations with look-up tables or integer computations, but such approximations suffer inferior accuracy or considerable hardware cost with long latency. This paper proposes an accurate and hardware-friendly approximation framework for efficient Transformer inference. Our framework employs a simple neural network as a universal approximator with its structure equivalently transformed into a LUT. The proposed framework called NN-LUT can accurately replace all the non-linear operations in popular BERT models with significant reductions in area, power consumption, and latency.

연구 동기 및 목표

  • Transformer 모델 추론 시 비선형 연산(GELU, Softmax, LayerNorm)의 높은 하드웨어 비용과 지연을 해결하기 위함.
  • 복잡한 데이터 경로와 고정밀 산술 연산을 피하는 일반적이고 하드웨어 友好的한 근사 프레임워크 개발을 위함.
  • 재학습 또는 미세조정 없이 사전 학습된 BERT 모델의 비선형 연산을 즉시 대체할 수 있도록 하기 위함.
  • 모델 정확도를 유지하면서 신경 처리 단위(NPU)의 면적, 전력 소비, 지연 시간을 줄이기 위함.
  • 기존 NPU 아키텍처에 통합하여 시스템 수준의 성능 향상을 입증하기 위함.

제안 방법

  • 비선형 함수를 보편적으로 근사하는 데 사용되는 하나의 은닉층을 가진 ReLU 신경망을 학습한 후, 이를 등가적인 LUT 기반 구현으로 수학적으로 변환한다.
  • 하드웨어를 변경하지 않고도 각 연산(GELU, Softmax 등)에 맞춰 LUT를 업데이트할 수 있어 다양한 비선형 함수 간 재사용이 가능하다.
  • 다양한 입력 범위에서의 근사 오차를 최소화하기 위해 일반적인 학습 전략을 적용한다.
  • 입력 스케일링을 사용하여 LUT 근사의 동적 범위를 확장함으로써 넓은 입력 도메인에서 정확도를 향상시킨다.
  • 라벨이 부여된 데이터가 필요 없거나 전체 모델을 재학습하지 않아도 되는 데이터셋 기반 캘리브레이션 방법을 도입한다.
  • 7-nm 공정 기술을 사용하여 하드웨어 합성 수행을 통해 최신 정수 기반 구현 대비 면적, 전력 소비, 지연 시간을 비교 분석한다.

실험 결과

연구 질문

  • RQ1비선형 연산을 위한 신경망을 정확도 손실 없이 LUT 기반 근사로 효과적으로 변환할 수 있는가?
  • RQ2기존 정수 기반 근사 방법 대비 NN-LUT 프레임워크의 하드웨어 효율성(면적, 전력 소비, 지연 시간)은 어떠한가?
  • RQ3NN-LUT는 GELU, Softmax, LayerNorm을 BERT 및 MobileBERT 모델에 최소한의 정확도 저하로 즉시 대체할 수 있는가?
  • RQ4기존 NPU 아키텍처에 NN-LUT를 통합함으로써 얻을 수 있는 시스템 수준의 성능 향상은 어떠한가?
  • RQ5라벨이 부여된 데이터셋이 없거나 전체 모델의 재학습 없이도 LUT 기반 근사가 캘리브레이션될 수 있는가?

주요 결과

  • NN-LUT는 최신 정수 기반 근사 기법(I-BERT) 대비 비선형 연산에서 면적을 2.63배 감소시키고 전력 소비를 36.4배 감소시켰다.
  • NN-LUT는 I-BERT 대비 핵심 경로 지연 시간을 3.93배 감소시켜 현저히 낮은 지연 시간을 입증했다.
  • 통합된 NPU에서 RoBERTa 추론 시 최대 26%의 시스템 수준 성능 향상을 달성했으며, 주로 최적화된 비선형 연산 실행 덕분이었다.
  • GLUE 및 SQuAD 벤치마크에서 NN-LUT는 원본 모델과 거의 동일한 정확도를 유지하며 정확도 저하가 거의 없었다.
  • 데이터셋 기반 캘리브레이션 방법은 라벨이 부여된 데이터나 전체 모델 재학습 없이도 LUT 정확도를 효과적으로 향상시켰다.
  • 하드웨어 합성 결과, NN-LUT의 LUT 기반 설계는 기존에 LUT를 포함하고 있는 NPU 아키텍처와 매우 효율적이고 호환 가능함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.