Skip to main content
QUICK REVIEW

[논문 리뷰] FORMS: Fine-grained Polarized ReRAM-based In-situ Computation for Mixed-signal DNN Accelerator

Geng Yuan, Payman Behnam|arXiv (Cornell University)|2021. 06. 16.
Advanced Memory and Neural Computing참고 문헌 76인용 수 9
한 줄 요약

FORMS는 교차바 면적을 두 배로 늘리거나 오프셋 회로를 추가하지 않고도, 하위 배열 내에서 같은 부호의 가중치를 강제하여 현장에서 행렬-벡터 곱셈을 효율적으로 수행할 수 있는 세분화되고 극성화된 ReRAM 기반 DNN 가속기이다. ADMM 기반 가중치 극성화, 구조적 프루닝, 양자화 및 제로 스킵 논리의 조합을 통해 FORMS는 ISAAC 대비 최대 377.9배의 성능 향상과 1.93배의 에너지 효율 향상을 달성했으며, 장치 변동성에 비해 정확도 손실이 최소화되었다.

ABSTRACT

Recent works demonstrated the promise of using resistive random access memory (ReRAM) as an emerging technology to perform inherently parallel analog domain in-situ matrix-vector multiplication -- the intensive and key computation in DNNs. With weights stored in the ReRAM crossbar cells as conductance, when the input vector is applied to word lines, the matrix-vector multiplication results can be generated as the current in bit lines. A key problem is that the weight can be either positive or negative, but the in-situ computation assumes all cells on each crossbar column with the same sign. The current architectures either use two ReRAM crossbars for positive and negative weights, or add an offset to weights so that all values become positive. Neither solution is ideal: they either double the cost of crossbars, or incur extra offset circuity. To better solve this problem, this paper proposes FORMS, a fine-grained ReRAM-based DNN accelerator with polarized weights. Instead of trying to represent the positive/negative weights, our key design principle is to enforce exactly what is assumed in the in-situ computation -- ensuring that all weights in the same column of a crossbar have the same sign. It naturally avoids the cost of an additional crossbar. Such weights can be nicely generated using alternating direction method of multipliers (ADMM) regularized optimization, which can exactly enforce certain patterns in DNN weights. To achieve high accuracy, we propose to use fine-grained sub-array columns, which provide a unique opportunity for input zero-skipping, significantly avoiding unnecessary computations. It also makes the hardware much easier to implement. Putting all together, with the same optimized models, FORMS achieves significant throughput improvement and speed up in frame per second over ISAAC with similar area cost.

연구 동기 및 목표

  • 하이브리드 신호 DNN 가속기에서 하드웨어 비용을 두 배로 늘리거나 오프셋 회로를 추가하지 않고도 부호가 있는 가중치를 ReRAM 교차바에 표현하는 데 도전하는 것.
  • 세분화된 하위 배열 내에서 같은 부호의 가중치를 강제하여 아날로그 영역에서 효율적인 현장 내 행렬-벡터 곱셈을 가능하게 하는 것.
  • 알고리즘-하드웨어 공동 설계를 통해 혼합 신호 DNN 가속기의 에너지 및 면적 효율을 향상시키는 것.
  • 세분화된 아키텍처와 제로 스킵 최적화를 활용하여 장치 비이상성과 노이즈에 대한 민감도를 최소화하는 것.
  • 하드웨어 변동성 하에서도 정확도를 유지하면서 고처리량과 저지연을 달성하는 것.

제안 방법

  • 모든 가중치가 동일한 하위 배열 열 내에서 동일한 부호를 가지도록 하기 위해 정규화를 포함한 교차 방향 다중승수법(ADMM)을 적용하여 DNN 학습을 수행함으로써 현장 계산을 가능하게 하는 것.
  • 하위 배열의 국소적 제약을 강제하기 위해 ReRAM 교차바를 세분화된 논리적 하위 배열(예: 8×8 또는 16×16)으로 나누어 하드웨어 복잡성과 노이즈 민감도를 감소시키는 것.
  • 입력 활성화가 0일 경우 계산을 건너뛰는 제로 스킵 논리를 도입하여 불필요한 연산과 계산 시간을 크게 감소시키는 것.
  • 정확도를 유지하면서 모델 크기와 하드웨어 자원 요구량을 줄이기 위해 구조적 프루닝과 양자화를 통합하는 것.
  • 아날로그 계산과 효율적인 ADC 변환을 지원하는 혼합 신호 아키텍처를 설계하여 면적과 전력 오버헤드를 감소시키는 것.
  • ReRAM 장치 변동성에 대한 복원력을 평가하기 위해 로그정규분포 모델링을 사용하여 제조 비이상성 하에서도 내구성을 검증하는 것.
Figure 1: Overall Flow of FORMS Algorithm/Hardware Co-designed.
Figure 1: Overall Flow of FORMS Algorithm/Hardware Co-designed.

실험 결과

연구 질문

  • RQ1세분화된 ReRAM 하위 배열 내에서 같은 부호의 가중치 제약 조건이 하이브리드 신호 DNN 가속기에서 이중 교차바 또는 오프셋 회로가 필요 없도록 할 수 있는가?
  • RQ2ADMM 기반 최적화가 DNN 정확도를 저하시키지 않고 극성화된 가중치 패턴을 얼마나 잘 강제할 수 있는가?
  • RQ3제로 스킵 논리는 ReRAM 기반 현장 가속기에서 계산 시간을 줄이고 처리량을 향상시키는 데 얼마나 효과적인가?
  • RQ4극성화, 프루닝, 양자화 및 제로 스킵의 병합된 영향이 최신 기술 대비 에너지 효율성과 처리량에 어떤 영향을 미치는가?
  • RQ5제안된 아키텍처는 ReRAM 장치의 변동성에 얼마나 견고한가? 그리고 현실적인 비이상성 하에서도 정확도를 유지하는가?

주요 결과

  • 모든 최적화가 적용된 경우 FORMS는 프래그먼트 크기가 16일 때 원본 ISAAC 가속기 대비 프레임당 초수(fps) 기준 최대 377.9배의 성능 향상을 달성한다.
  • 최적화 프레임워크만으로도 ISAAC의 성능이 10.7×에서 377.9×로 향상되어 알고리즘-하드웨어 공동 설계의 잠재력을 입증한다.
  • 최적화된 ISAAC 대비 FORMS는 면적 효율성을 1.50배 향상시키고 에너지 효율성을 1.93배 향상시켰으며, 전력과 면적 비용은 거의 동일하다.
  • 10% 장치 변동성(로그정규분포, σ=0.1) 하에서 극성화와 양자화를 적용했을 경우 CIFAR-10에서 정확도 저하가 1.8%로 매우 미미하고, ImageNet에서는 4.2% 수준이다.
  • 제로 스킵은 모델 최적화와 결합되었을 때 10.7×에서 377.9×의 성능 향상 기여를 하며, 특히 프래그먼트 크기가 16일 때 두드러진다.
  • 아키텍처는 비이상성에 대해 강건하며, 프루닝은 변동성 하에서 추가로 1.3%의 정확도 저하만 유발하며, 프루닝 비율 제어를 통해 관리 가능한 수준이다.
Figure 2: Structured pruning
Figure 2: Structured pruning

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.