Skip to main content
QUICK REVIEW

[논문 리뷰] PIM-QAT: Neural Network Quantization for Processing-In-Memory (PIM) Systems

Qing Jin, Zhiyu Chen|arXiv (Cornell University)|2022. 09. 18.
Advanced Memory and Neural Computing인용 수 4
한 줄 요약

이 논문은 PIM 시스템의 고유한 하드웨어 제약 조건(저해상도 아날로그-디지털 변환 및 노이즈, 비선형성 등 비이상적 효과 포함)을 고려한 양자화 인식 학습 방법인 PIM-QAT를 제안한다. 정방향 및 역방향 전파에서 재스케일링을 통합하고 배치 정규화(BN) 校정 및 조정된 정밀도 학습을 사용함으로써, PIM 시스템에서의 추론 정확도를 다양한 네트워크 깊이로 CIFAR10 및 CIFAR100에서 기존 디지털 하드웨어에서 양자화된 모델과 유사하게 달성한다.

ABSTRACT

Processing-in-memory (PIM), an increasingly studied neuromorphic hardware, promises orders of energy and throughput improvements for deep learning inference. Leveraging the massively parallel and efficient analog computing inside memories, PIM circumvents the bottlenecks of data movements in conventional digital hardware. However, an extra quantization step (i.e. PIM quantization), typically with limited resolution due to hardware constraints, is required to convert the analog computing results into digital domain. Meanwhile, non-ideal effects extensively exist in PIM quantization because of the imperfect analog-to-digital interface, which further compromises the inference accuracy. In this paper, we propose a method for training quantized networks to incorporate PIM quantization, which is ubiquitous to all PIM systems. Specifically, we propose a PIM quantization aware training (PIM-QAT) algorithm, and introduce rescaling techniques during backward and forward propagation by analyzing the training dynamics to facilitate training convergence. We also propose two techniques, namely batch normalization (BN) calibration and adjusted precision training, to suppress the adverse effects of non-ideal linearity and stochastic thermal noise involved in real PIM chips. Our method is validated on three mainstream PIM decomposition schemes, and physically on a prototype chip. Comparing with directly deploying conventionally trained quantized model on PIM systems, which does not take into account this extra quantization step and thus fails, our method provides significant improvement. It also achieves comparable inference accuracy on PIM systems as that of conventionally quantized models on digital hardware, across CIFAR10 and CIFAR100 datasets using various network depths for the most popular network topology.

연구 동기 및 목표

  • 저해상도 아날로그-디지털 변환과 하드웨어 비이상적 요소로 인한 심각한 정확도 저하를 해결하기 위해.
  • 행렬 곱셈이 더 작은 부분집합들로 분해되는 PIM 시스템의 고유한 계산 플로우를 고려한 학습 방법을 개발하기 위해.
  • 정방향 및 역방향 전파에서 PIM 양자화의 동역학을 모델링하여 학습의 수렴성과 안정성을 향상시키기 위해.
  • 실제 PIM 칩에서의 비이상적 선형성과 확률적 열노이즈의 악영향을 소프트웨어 수준의 校정 및 정밀도 조정을 통해 억제하기 위해.
  • 디지털 하드웨어에서 일반적으로 양자화된 모델의 성능을 따라하거나 초월하는 PIM 시스템에서의 추론 정확도를 달성하기 위해.

제안 방법

  • 역전파 및 정방향 전파 중 PIM 양자화 단계를 명시적으로 모델링하는 PIM 양자화 인식 학습(PIM-QAT) 알고리즘을 제안한다.
  • 특히 저해상도 PIM 비트 폭(예: 3–6비트)에서 수렴성을 향상시키고 학습 동역학을 안정화하기 위해 정방향 및 역방향 전파에서 재스케일링 기법을 도입한다.
  • 실제 PIM 칩의 비선형성과 노이즈로 인한 성능 저하를 완화하기 위해 배치 정규화(BN) 校정을 활용하여 추가 학습 없이도 강건성을 향상시킨다.
  • 특히 PIM 전달 함수의 이득 및 오프셋 변동이 있는 상황에서 하드웨어 유도 왜곡을 보완하기 위해 조정된 정밀도 학습을 적용한다.
  • 세 가지 PIM 분해 기법과 물리적 프로토타입 칩을 통해 방법을 검증하여 실제 적용 가능성 확보한다.
  • 이dealized 및 실제 PIM 양자화 곡선을 사용하여 비이상적 조건(확률적 노이즈, 비선형성 포함) 하에서 성능을 시뮬레이션하고 평가한다.

실험 결과

연구 질문

  • RQ1저해상도 양자화와 비이상적 아날로그 행동으로 인해 모델 정확도가 심각하게 떨어지는 PIM 시스템에서 학습을 어떻게 안정화할 수 있는가?
  • RQ2PIM 양자화 단계가 역행 불가능하고 하드웨어 제약이 있는 조건에서 수렴성과 정확도를 유지하는 데 효과적인 학습 기법은 무엇인가?
  • RQ3소프트웨어 수준의 校정 기법(예: BN 校정)이 PIM 시스템에서 노이즈 및 비선형성과 같은 하드웨어 비이상적 요소를 얼마나 효과적으로 보완할 수 있는가?
  • RQ4통합된 학습 방법이 디지털 하드웨어에서 일반적으로 양자화된 모델의 성능을 따라하거나 초월하는 PIM 시스템에서의 정확도를 달성할 수 있는가?
  • RQ5정방향 및 역방향 전파에서의 재스케일링이 저해상도 PIM 비트 폭에서 학습 안정성과 최종 정확도에 어떤 영향을 미치는가?

주요 결과

  • ResNet20를 사용한 CIFAR10에서 8비트 PIM 양자화로 PIM-QAT는 90.8%의 상위-1 정확도를 달성하여 디지털 하드웨어에서 일반적으로 양자화된 모델의 성능과 동일한 성능을 보였다.
  • 7비트 PIM 양자화에서 PIM-QAT는 90.8%의 정확도를 기록했고, 기준 방법은 완전히 실패하여 정확도가 10.0%에 머물렀다. 이는 PIM 인식 학습의 必要성을 입증한다.
  • 정방향 및 역방향 전파에서의 재스케일링이 필수적이다. 이를 생략할 경우 저비트 폭(예: 3–5비트)에서 학습이 불안정해지고 정확도가 20% 이하로 급격히 떨어진다.
  • BN 校정은 실제 PIM 시스템에서 성능 향상을 크게 이끌어내어 이상화된 조건과 실제 조건 간의 격차를 줄였고, 비선형성 및 노이즈 영향에서 회복 가능하게 했다.
  • 이득 및 오프셋 변동이 있는 72개 및 144개의 PIM 전달 곡선을 대상으로 BN 校정을 적용했을 때, 정확도는 근처 무작위 수준(10.0%)에서 90% 이상으로 복구되었으며, 실제 적용에서의 효과를 입증했다.
  • 이 방법은 다양한 PIM 분해 기법과 네트워크 깊이에 대해 일반화 가능하며, CIFAR10 및 CIFAR100에서 ResNet20 및 ResNet56 모두에서 일관된 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.