Skip to main content
QUICK REVIEW

[논문 리뷰] A 64-core mixed-signal in-memory compute chip based on phase-change memory for deep neural network inference

Manuel Le Gallo, Riduan Khaddam-Aljameh|arXiv (Cornell University)|2022. 12. 06.
Advanced Memory and Neural ComputingEngineering인용 수 18
한 줄 요약

이 논문은 깊이 신경망 추론을 완전히 내장형으로 수행하는 64코어 혼합 신호 인-memory 컴퓨팅 칩을 제안한다. 이 칩은 상변화 메모리(PCM) 기반으로 구현되었으며, 소프트웨어 수준의 정확도에 근접한 성능를 달성한다. 64개의 PCM 기반 AIMC 코어를 디지털 처리 회로와 코어 간 통신 기능과 통합함으로써, 8비트 MVM에 대해 63.1 TOPS의 처리량과 9.76 TOPS/W의 에너지 효율성을 달성한다.

ABSTRACT

The need to repeatedly shuttle around synaptic weight values from memory to processing units has been a key source of energy inefficiency associated with hardware implementation of artificial neural networks. Analog in-memory computing (AIMC) with spatially instantiated synaptic weights holds high promise to overcome this challenge, by performing matrix-vector multiplications (MVMs) directly within the network weights stored on a chip to execute an inference workload. However, to achieve end-to-end improvements in latency and energy consumption, AIMC must be combined with on-chip digital operations and communication to move towards configurations in which a full inference workload is realized entirely on-chip. Moreover, it is highly desirable to achieve high MVM and inference accuracy without application-wise re-tuning of the chip. Here, we present a multi-core AIMC chip designed and fabricated in 14-nm complementary metal-oxide-semiconductor (CMOS) technology with backend-integrated phase-change memory (PCM). The fully-integrated chip features 64 256x256 AIMC cores interconnected via an on-chip communication network. It also implements the digital activation functions and processing involved in ResNet convolutional neural networks and long short-term memory (LSTM) networks. We demonstrate near software-equivalent inference accuracy with ResNet and LSTM networks while implementing all the computations associated with the weight layers and the activation functions on-chip. The chip can achieve a maximal throughput of 63.1 TOPS at an energy efficiency of 9.76 TOPS/W for 8-bit input/output matrix-vector multiplications.

연구 동기 및 목표

  • 메모리와 처리 유닛 간 반복적인 가중치 이동으로 인한 에너지 비효율성을 해결하기 위해.
  • 아날로그 인-memory 컴퓨팅 (AIMC)을 내장형 디지털 연산 및 통신과 융합하여 종단 간 내장형 추론을 가능하게 하기 위해.
  • 특정 응용 프로그램에 맞춘 재조정 없이도 높은 추론 정확도와 에너지 효율성을 달성하기 위해 비버니시브 PCM을 사용해 고밀도의 지속적 가중치 저장을 실현하기 위해.
  • 단일 코어나 소규모 네트워크 구현을 넘어서, 단일 칩에 다중 코어, 다중 레이어 DNN 워크로드를 처리할 수 있도록 AIMC를 확장하기 위해.

제안 방법

  • 비휘류성 시냅스 가중치 저장을 위해 후단 공정 통합된 상변화 메모리(PCM)를 탑재한 14nm CMOS 칩의 설계 및 제조.
  • 각 코어가 PCM의 도전도 상태를 직접 이용해 메모리 내에서 행렬-벡터 곱셈(MVM)을 수행하는 64개의 독립적 256x256 AIMC 코어 구현.
  • 대규모 레이어에 걸쳐 다중 코어를 통해 분산 MVM 실행을 가능하게 하기 위해 코어 간 연결을 위한 전용 내장형 통신 네트워크 사용.
  • 활성화 함수(예: ReLU, tanh) 및 데이터 변환(PWM, ADC, DAC)을 수행하기 위해 내장된 디지털 유닛(LDPU 및 GDPU) 통합.
  • Eq. (1)을 사용한 도전도 매핑 기법을 적용하여 네트워크 가중치를 PCM 셀의 도전도로 매핑하며, ADC 포화 및 전류 제한에 의해 코어별로 $G_{\text{max}}$ 제약을 설정.
  • 입력 정밀도(8비트 PWM), ADC 정밀도(12비트), LDPU/GDPU 데이터 변환(8비트), 및 측정된 코어별 가중치 노이즈를 다항식 피팅을 통해 반영한 기능적 하드웨어 인식 시뮬레이션 모델 개발.

실험 결과

연구 질문

  • RQ1비휘류성 PCM을 사용한 다중 코어, 완전 통합 AIMC 칩이 소프트웨어 수준의 정확도에 근접한 종단 간 DNN 추론을 달성할 수 있는가?
  • RQ2모든 MVM 및 디지털 연산을 내장형으로 수행할 경우, PCM 기반 AIMC 칩의 최대 처리량과 에너지 효율성은 얼마인가?
  • RQ3PCM 및 ADC 구성 요소의 비이상적 특성과 코어 간 가중치 노이즈가 다중 코어에서 추론 정확도에 미치는 영향은 어떠한가?
  • RQ4외부 메모리나 계층별 재프로그래밍 없이도 대규모 DNN(예: ResNet-9, LSTM)을 64개의 코어에 효율적으로 매핑할 수 있는가?
  • RQ5코어별로 $G_{\text{max}}$ 스케일링이 다중 코어 PCM 아키텍처에서 MVM 정확도와 에너지 효율성에 미치는 영향은 어떠한가?

주요 결과

  • 8비트 입력/출력 행렬-벡터 곱셈에 대해 최대 처리량 63.1 TOPS, 에너지 효율성 9.76 TOPS/W를 달성한다.
  • 특정 응용 프로그램에 맞춘 재조정 없이도 ResNet-9 및 LSTM 기반 이미지 캡션 생성 네트워크에서 소프트웨어 수준의 정확도에 근접한 추론 정확도를 입증한다.
  • 통합된 LDPU 및 GDPU 유닛을 통해 MVM 및 디지털 활성화 함수(예: ReLU, tanh)의 완전한 내장형 실행을 지원한다.
  • 가중치 노이즈는 코어별로 독립적이고 가중치에 의존하는 가우시안 분포로 모델링되며, 측정된 코어별 오차를 다항식 함수로 피팅하여 표준 편차를 추정한다.
  • TDP PCM을 사용한 ResNet-9에서는 $G_{\text{max}}$ 값이 최대 160까지 사용되며, 이는 더 넓은 도전도 범위 활용과 향상된 MVM 정확도를 가능하게 한다.
  • 전력 측정 결과에 따르면 동적 전력은 주로 ADC 및 디지털 공급 전원에 의해 지배되며, 총 에너지는 모든 모니터링된 공급 전원의 정적 및 동적 기여의 합으로 계산된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.