Skip to main content
QUICK REVIEW

[논문 리뷰] TIMELY: Pushing Data Movements and Interfaces in PIM Accelerators Towards Local and in Time Domain

Weitao Li, Pengfei Xu|arXiv (Cornell University)|2020. 05. 03.
Advanced Memory and Neural Computing참고 문헌 77인용 수 8
한 줄 요약

TIMELY는 데이터 국지성에 기반한 아날로그 로컬 버퍼(ANLB), D/A 및 A/D 변환 에너지를 줄이기 위한 타임도메인 인터페이스(TDI), 그리고 입력을 한 번만 읽는(O2IR) 매핑 방법을 활용하여 에너지 효율성을 향상시킨 ReRAM 기반 PIM 가속기의 새로운 설계를 제안한다. 이는 PRIME 대비 최대 31.2배 높은 계산 밀도와 736.6배 높은 처리량을 달성하며, 최신 R2PIM 가속기 대비 에너지 효율성에서 10배 향상된다.

ABSTRACT

Resistive-random-access-memory (ReRAM) based processing-in-memory (R$^2$PIM) accelerators show promise in bridging the gap between Internet of Thing devices' constrained resources and Convolutional/Deep Neural Networks' (CNNs/DNNs') prohibitive energy cost. Specifically, R$^2$PIM accelerators enhance energy efficiency by eliminating the cost of weight movements and improving the computational density through ReRAM's high density. However, the energy efficiency is still limited by the dominant energy cost of input and partial sum (Psum) movements and the cost of digital-to-analog (D/A) and analog-to-digital (A/D) interfaces. In this work, we identify three energy-saving opportunities in R$^2$PIM accelerators: analog data locality, time-domain interfacing, and input access reduction, and propose an innovative R$^2$PIM accelerator called TIMELY, with three key contributions: (1) TIMELY adopts analog local buffers (ALBs) within ReRAM crossbars to greatly enhance the data locality, minimizing the energy overheads of both input and Psum movements; (2) TIMELY largely reduces the energy of each single D/A (and A/D) conversion and the total number of conversions by using time-domain interfaces (TDIs) and the employed ALBs, respectively; (3) we develop an only-once input read (O$^2$IR) mapping method to further decrease the energy of input accesses and the number of D/A conversions. The evaluation with more than 10 CNN/DNN models and various chip configurations shows that, TIMELY outperforms the baseline R$^2$PIM accelerator, PRIME, by one order of magnitude in energy efficiency while maintaining better computational density (up to 31.2$ imes$) and throughput (up to 736.6$ imes$). Furthermore, comprehensive studies are performed to evaluate the effectiveness of the proposed ALB, TDI, and O$^2$IR innovations in terms of energy savings and area reduction.

연구 동기 및 목표

  • 입력 및 부분합(Psum) 이동에 따른 고비용 에너지 소비로 인해 ReRAM 기반 PIM 가속기의 에너지 효율성이 떨어지는 문제를 해결한다.
  • 기존 PIM 아키텍처에서 아날로그에서 디지털(DAC) 및 디지털에서 아날로그(ADC)로의 변환에 따른 에너지 소비의 한계를 극복한다.
  • 자원이 제한된 IoT 기기에서 낮은 에너지 소비를 유지하면서도 계산 밀도와 처리량을 향상시킨다.
  • PIM 가속기에서 데이터 이동 및 인터페이스를 국소화 및 타임도메인 최적화 방향으로 이르기 위한 통합적인 아키텍처 솔루션을 개발한다.

제안 방법

  • 중간 부분합과 입력 데이터를 아날로그 형태로 저장하기 위해 ReRAM 크로스바 내부에 아날로그 로컬 버퍼(ANLB)를 도입하여 자주 발생하는 데이터 이동 횟수를 줄인다.
  • 시간 분할 신호 전송 방식을 활용해 활성화되는 변환 회로의 수를 최소화함으로써 D/A 또는 A/D 변환 당 에너지를 감소시키는 타임도메인 인터페이스(TDI)를 적용한다.
  • 각 입력을 한 번만 읽는 방식으로 설계된 오직 한 번만 입력을 읽는(O2IR) 매핑 방법을 도입하여 입력 액세스 횟수와 D/A 변환 횟수를 최소화한다.
  • ANLB와 O2IR를 TDI와 통합하여 외부 메모리로의 데이터 이동을 최소화하고 인터페이스 에너지를 감소시킨다.
  • 파이ipel라인된 데이터 플로우를 갖춘 다중 서브칩 시스템 아키텍처로 TIMELY를 설계하여 처리량을 극대화하고 칩 간 에너지 오버헤드를 최소화한다.
  • FF 서브어레이 내부의 서브버퍼(X-subBufs 및 P-subBufs)를 포함한 하이브리드 메모리 계층을 사용하여 데이터 국지성을 높이고 에너지 집약적인 애드어레이 간 이동을 줄인다.

실험 결과

연구 질문

  • RQ1ReRAM 크로스바 내부에서 아날로그 데이터 국지성을 어떻게 활용하여 PIM 가속기에서 입력 및 Psum 이동에 따른 에너지 소비를 줄일 수 있는가?
  • RQ2타임도메인 인터페이싱은 아날로그 PIM 아키텍처에서 개별 D/A 및 A/D 변환의 에너지 비용을 어느 정도 감소시킬 수 있는가?
  • RQ3O2IR와 같은 새로운 입력 액세스 매핑 전략이 R2PIM 가속기에서 총 D/A 변환 횟수와 입력 액세스 횟수를 크게 줄일 수 있는가?
  • RQ4ANLB, TDI, O2IR의 조합이 실제 R2PIM 설계에서 에너지 효율성, 계산 밀도, 처리량에 미치는 통합적 영향은 어떠한가?
  • RQ5제안된 기술들은 다양한 CNN/DNN 모델과 칩 구성에서 에너지 절감 및 면적 효율성 측면에서 어떻게 스케일링되는가?

주요 결과

  • TIMELY는 고밀도 ReRAM와 ANLB를 활용하여 기준인 PRIME 가속기 대비 최대 31.2배 높은 계산 밀도를 달성한다.
  • 최적화된 데이터 플로우와 메모리 액세스 오버헤드 감소로 인해 처리량이 PRIME 대비 최대 736.6배 향상된다.
  • 입력 및 Psum 이동 에너지 감소로 인해 PRIME 대비 10배, ISAAC 대비 18.2배 높은 에너지 효율성을 확보한다.
  • ANLB와 O2IR의 조합은 PRIME 기반 구성에서 내부 뱅크 간 데이터 이동 에너지를 68% 감소시켜 아키텍처 수준에서 뚜렷한 에너지 절감 효과를 입증한다.
  • TDI를 통해 시간 분할 신호 전송 방식을 구현함으로써 D/A 변환 당 에너지를 감소시켜, 높은 변환 빈도에도 불구하고 총 인터페이스 에너지를 크게 낮춘다.
  • 서브칩 구성에 따른 면적 스케일링은 에너지에 거의 영향을 주지 않으며, 처리량에 대해서도 미미한 영향을 미쳐 TIMELY 아키텍처의 스케일러빌리티와 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.