Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Block Floating-Point for Analog Deep Learning Hardware

Ayon Basumallik, Darius Bunandar|arXiv (Cornell University)|2022. 05. 12.
Analog and Mixed-Signal Circuit Design인용 수 5
한 줄 요약

이 논문은 저해상도 아날로그 혼합신호(AMS) 하드웨어에서 고정밀도 아날로그 딥러닝 추론을 가능하게 하기 위해 이득을 갖춘 적응형 블록 부동소수점(ABFP)을 도입한다. 블록 행렬을 동적으로 스케일링하고 증폭을 적용함으로써 ABFP는 ADC 비트 정밀도를 늘리지 않으면서도 양자화 오차를 감소시킨다. 결과적으로, float32와 비교해 MLPerf™ 벤치마크에서 <1%의 정확도 손실을 기록했으며, 8비트 ADC조차도 성능을 유지한다.

ABSTRACT

Analog mixed-signal (AMS) devices promise faster, more energy-efficient deep neural network (DNN) inference than their digital counterparts. However, recent studies show that DNNs on AMS devices with fixed-point numbers can incur an accuracy penalty because of precision loss. To mitigate this penalty, we present a novel AMS-compatible adaptive block floating-point (ABFP) number representation. We also introduce amplification (or gain) as a method for increasing the accuracy of the number representation without increasing the bit precision of the output. We evaluate the effectiveness of ABFP on the DNNs in the MLPerf datacenter inference benchmark -- realizing less than $1\%$ loss in accuracy compared to FLOAT32. We also propose a novel method of finetuning for AMS devices, Differential Noise Finetuning (DNF), which samples device noise to speed up finetuning compared to conventional Quantization-Aware Training.

연구 동기 및 목표

  • 딥러닝(DNN) 추론에서 저해상도 고정소수점 표현으로 인한 정확도 저하 문제를 해결하기 위해.
  • 모델 정확도를 훼손하지 않고도 ADC 비트 정밀도를 낮춤으로써 AMS 기반 DNN 가속기의 에너지 소비를 줄이기 위해.
  • 하드웨어에 의한 노이즈와 양자화 오차에도 불구하고 높은 모델 품질을 유지할 수 있는 새로운 수치 표현 및 피지터링 방법을 개발하기 위해.
  • ABFP와 이득이 함께 작용할 경우, 최소한의 하드웨어 오버헤드와 에너지 비용으로도 AMS 장치에서 고정밀도 DNN 추론을 가능하게 함을 입증하기 위해.

제안 방법

  • 행렬 곱셈 타일 내에서 입력 벡터를 공유 지수를 사용해 동적으로 스케일링함으로써, 적응형 블록 부동소수점(ABFP)이라는 수치 표현 방식을 제안한다.
  • 출력 비트 폭을 늘리지 않고도 효과적 정밀도를 높이기 위해 증폭(gain)을 도입함으로써 동적 범위와 정확도를 향상시킨다.
  • 가중치와 활성화가 아날로그 계산 이전에 스케일링되고, 누적 후에 재정규화되는 방식으로 ABFP를 행렬 곱셈 타일에 적용한다.
  • 실제 장치 노이즈를 학습 중에 샘플링하는 기법인 차별적 노이즈 피지터링(DNF)이라는 새로운 피지터링 방법을 도입하여 수렴 속도를 가속하고 강건성을 향상시킨다.
  • 양자화 인식 학습(QAT)과 DNF를 결합하여 DNN를 피지터링함으로써, ABFP 양자화 및 하드웨어 노이즈 이후 정확도 복구를 가능하게 한다.
  • 계산 비용을 줄이기 위해 ABFP 스케일을 지수만으로 제한함으로써 최소한의 정밀도 손실을 감수하여 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1ABFP와 이득이 함께 작용할 경우, ADC 비트 정밀도를 크게 낮추면서도 AMS 하드웨어에서 고정밀도 DNN 추론을 가능하게 할 수 있는가?
  • RQ2대규모 DNN에 대해 ABFP는 고정소수점 표현 대비 정확도와 에너지 효율성 측면에서 어떻게 비교되는가?
  • RQ3노이즈가 있는 AMS 장치에서, 차별적 노이즈 피지터링(DNF)이 기존의 양자화 인식 학습(QAT)보다 수렴 속도를 빠르게 하고 모델 품질을 더 효과적으로 복구할 수 있는가?
  • RQ4출력 차원 수와 결정 경계의 복잡도가 ABFP 양자화 및 하드웨어 노이즈에 대한 DNN의 강건성에 어떤 영향을 미치는가?
  • RQ5ABFP와 이득의 조합이 이전의 AMS 설계 대비 고정밀도 추론의 에너지 비용을 얼마나 줄이는가?

주요 결과

  • ABFP와 이득을 사용하면 8비트 ADC만으로도 모든 여섯 개의 MLPerf™ 데이터센터 추론 벤치마크에서 float32와 비교해 <1%의 정확도 손실을 기록한다.
  • 이전 연구(Rekhi 등, 2021)에서 최적 구성으로 설정된 것보다 약 2.8배의 에너지 소비 감소를 기록했다. 주로 ADC 비트 정밀도를 12.5비트에서 8비트로 낮춘 데 기인한다.
  • ResNet50의 경우, ADC 비트 수를 줄이는 데 기인한 에너지 절감(2^4.5×)이 이득을 적용하는 비용(8배)을 상회하여 총 에너지 소비가 2.8배 감소한다.
  • DNF는 실제 장치 노이즈를 샘플링함으로써 피지터링 수렴 속도를 크게 향상시키며, 기존 QAT보다 수렴 속도와 정확도 복구 능력에서 뛰어나다.
  • 출력 클래스 수가 적은 모델(예: 2개)은 출력 차원이 높은 모델(예: 1000개)보다 ABFP 양자화 및 노이즈에 더 강건한 편이며, 이는 모델 복잡도가 강건성에 영향을 미친다는 것을 시사한다.
  • ABFP 변환의 계산 오버헤드는 큰 행렬 타일을 통해 분할되어, 저해상도 ADC로 인한 에너지 절감과 비교해 무시할 수 없을 정도로 낮다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.