Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking and modeling of analog and digital SRAM in-memory computing architectures

Pouya Houshmand, Jiacong Sun|arXiv (Cornell University)|2023. 05. 25.
Advanced Memory and Neural Computing인용 수 6
한 줄 요약

이 논문은 다양한 설계 간 공정하고 정량적인 비교를 가능하게 하기 위해 아날로그 인메모리 컴퓨팅(AIMC) 및 디지털 인메모리 컴퓨팅(DIMC) 아키텍처를 평가하기 위한 통합 분석 비용 모델을 제안한다. ZigZag DSE 프레임워크에 통합된 이 모델은 큰 AIMC 어레이가 고재사용 컨볼루션(예: ResNet8)에서 뛰어난 성능을 보이며, 작은 분산형 DIMC 마크로가 저재사용, 포인트와이즈 레이어(예: MobileNetV1)에서 더 우수한 성능을 보임을 드러내며, 어레이 크기, 데이터플로우, 에너지 효율성 간의 핵심적 트레이드오프를 밝혀낸다.

ABSTRACT

In-memory-computing is emerging as an efficient hardware paradigm for deep neural network accelerators at the edge, enabling to break the memory wall and exploit massive computational parallelism. Two design models have surged: analog in-memory-computing (AIMC) and digital in-memory-computing (DIMC), offering a different design space in terms of accuracy, efficiency and dataflow flexibility. This paper targets the fair comparison and benchmarking of both approaches to guide future designs, through a.) an overview of published architectures; b.) an analytical cost model for energy and throughput; c.) scheduling of workloads on a variety of modeled IMC architectures for end-to-end network efficiency analysis, offering valuable workload-hardware co-design insights.

연구 동기 및 목표

  • 다양한 기술 및 설계 파rameter에도 불구하고 아날로그 및 디지털 인메모리 컴퓨팅(AIMC/DIMC) 아키텍처 간 공정하고 정량적인 벤치마킹을 가능하게 하기 위해.
  • 공개된 AIMC 및 DIMC 설계 전반에 검증된 에너지 및 처리량을 위한 통합 분석 비용 모델을 개발하기 위해.
  • 실제 DNN 워크로드의 종합적 효율성 분석을 위해 이 모델을 ZigZag 설계 공간 탐색(DSE) 프레임워크에 통합하기 위해.
  • 다양한 아키텍처와 tinyMLPerf 벤치마크를 대상으로 공간적 및 시간적 매핑을 평가함으로써 워크로드-하드웨어 공동 설계 통찰을 제공하기 위해.
  • 네트워크 특성 및 어레이 구성에 따라 AIMC 및 DIMC 패러다임의 강점과 한계를 규명하기 위해.

제안 방법

  • 저자들은 다양한 공정 기술을 기반으로 한 10개의 공개된 AIMC 및 DIMC 설계에서 어레이 크기, 마크로 수, 공정 노드, 정밀도 등의 아키텍처 파라미터를 추출한다.
  • 에너지 및 처리량을 추정하기 위한 통합 분석 비용 모델을 개발하였으며, 상대 오차 약 15% 이내로 설계 포인트에 대해 검증되었다.
  • 모델은 마크로 수준의 에너지 소비와 외부 메모리 수준까지의 데이터 이동 비용을 포함하여, 운영수의 재사용 및 주변 회로 오버헤드를 고려한다.
  • 모델은 각 네트워크 레이어 및 하드웨어 구성에 최적의 공간적 및 시간적 매핑을 탐색하기 위해 ZigZag DSE 프레임워크에 통합되었다.
  • 실제 DNN 워크로드의 종합적 효율성을 평가하기 위해 tinyMLPerf 벤치마크 모델들(예: DeepAutoEncoder, ResNet8, MobileNetV1, DS-CNN)을 대상으로 워크로드 평가를 수행하였다.
  • 다양한 어레이 크기 및 마크로 수에 따라 활용도와 오버헤드 간의 트레이드오프를 드러내기 위해, 에너지 분포 및 외부 메모리로의 데이터 트래픽을 분석하였다.

실험 결과

연구 질문

  • RQ1다양한 AIMC 및 DIMC 아키텍처 파라미터(어레이 크기, 마크로 수, 공정 노드)가 실제 DNN 워크로드의 에너지 효율성과 처리량에 어떤 영향을 미치는가?
  • RQ2큰 어레이 기반 AIMC 아키텍처가 더 작은 분산형 DIMC 아키텍처를 능가하는 상황은 언제이며, 반대로 어떤 경우에 반대가 성립하는가?
  • RQ3공간적 및 시간적 매핑의 선택이 다양한 DNN 레이어에서 IMC 가속기의 에너지 효율성에 어떤 영향을 미치는가?
  • RQ4다양한 IMC 설계 포인트에서 마크로 수준의 에너지 효율성과 외부 메모리 데이터 이동 오버헤드 간의 상대적 트레이드오프는 어떠한가?
  • RQ5통합 분석 모델이 이질적인 AIMC 및 DIMC 설계 간의 성능을 얼마나 정확하게 예측할 수 있는가?

주요 결과

  • 큰 AIMC 어레이가 가중치 재사용이 많은 레이어(예: ResNet8)에서 최고의 에너지 효율성을 달성하며, 이는 피처맵 픽셀 간의 가중치 재사용으로 인해 쓰기 비용이 분산되기 때문이다.
  • 전체적으로 완전히 연결된 레이어만을 포함하는 네트워크(예: DeepAutoEncoder)에서는 AIMC의 이점이 사라지며, 빈번한 가중치 재기록으로 인해 높은 에너지 비용이 발생한다.
  • 작은 분산형 DIMC 마크로는 저재사용, 포인트와이즈 및 딥웨이즈 컨볼루션 레이어(예: MobileNetV1, DS-CNN)에서 큰 어레이보다 더 뛰어난 성능을 보이며, 이는 큰 어레이가 계산 활용도가 낮아지기 때문이다.
  • 마크로 수가 증가하면 비-IMC 차원(예: OX, OY, G)의 공간 병렬성이 향상되지만, 피처맵 및 부분합에 대한 외부 메모리 데이터 이동이 증가하여 에너지 오버헤드가 증가한다.
  • 통합 분석 모델은 공개된 설계 포인트에 대해 약 15%의 상대 오차로 검증되었으며, 이는 이질적인 아키텍처 간의 벤치마킹에 매우 높은 정확도를 보임을 입증한다.
  • 모델을 ZigZag에 통합함으로써 최적 매핑의 체계적 탐색이 가능해졌으며, 이는 최적 설계가 워크로드 특성과 레이어 유형에 따라 크게 달라진다는 것을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.