Skip to main content
QUICK REVIEW

[논문 리뷰] Direct CMOS Implementation of Neuromorphic Temporal Neural Networks for Sensory Processing

Harideep Nair, John Paul Shen|arXiv (Cornell University)|2020. 08. 27.
Advanced Memory and Neural Computing참고 문헌 22인용 수 7
한 줄 요약

이 논문은 확장 가능한 마이크로아키텍처 빌딩 블록—뉴런, 다중 뉴런 컬럼, 다중층 TNN—을 사용하여 시간 신경망(TNNs)의 직접적 CMOS 하드웨어 구현을 제시한다. 이는 뇌 유사하고 에너지 효율적인 감각 처리를 가능하게 한다. 프로토타입은 7 nm CMOS에서 1.54 mm² 면적과 7.26 mW 전력으로 28×28 이미지에서 107M FPS를 달성한다. 이는 초저전력 엣지 AI 시스템에 대한 실현 가능성을 입증한다.

ABSTRACT

Temporal Neural Networks (TNNs) use time as a resource to represent and process information, mimicking the behavior of the mammalian neocortex. This work focuses on implementing TNNs using off-the-shelf digital CMOS technology. A microarchitecture framework is introduced with a hierarchy of building blocks including: multi-neuron columns, multi-column layers, and multi-layer TNNs. We present the direct CMOS gate-level implementation of the multi-neuron column model as the key building block for TNNs. Post-synthesis results are obtained using Synopsys tools and the 45 nm CMOS standard cell library. The TNN microarchitecture framework is embodied in a set of characteristic equations for assessing the total gate count, die area, compute time, and power consumption for any TNN design. We develop a multi-layer TNN prototype of 32M gates. In 7 nm CMOS process, it consumes only 1.54 mm^2 die area and 7.26 mW power and can process 28x28 images at 107M FPS (9.34 ns per image). We evaluate the prototype's performance and complexity relative to a recent state-of-the-art TNN model.

연구 동기 및 목표

  • 표준 디지털 CMOS 기술을 사용하여 시간 신경망(TNNs)을 실현 가능한지 탐색한다.
  • 뉴런, 다중 뉴런 컬럼, 다중층 TNN과 같은 계층적 빌딩 블록 기반으로 확장 가능한 마이크로아키텍처 프레임워크를 개발한다.
  • CMOS에서 최적화된 STDP 및 R-STDP 학습 규칙을 통해 생물학적으로 타당한 비지도, 온라인 학습을 가능하게 한다.
  • 행렬 곱셈이나 MAC 유닛 없이도 TNN이 고속, 저전력 감각 처리를 달성할 수 있음을 입증한다.
  • 향후 TNN 하드웨어 탐색을 안내하기 위해 면적, 지연, 전력, 게이트 수에 대한 설계 공간 특성화 방정식을 제공한다.

제안 방법

  • 경사 없는 림프 반응(RNL)과 STDP/R-STDP 학습 규칙을 갖춘 확장 가능한 뉴런의 게이트 수준 Verilog 모델 설계.
  • 승자독점(WTA) 횡방향 억제를 통한 다중 뉴런 컬럼 구현으로 경쟁적 동역학을 가능하게 한다.
  • 합성원 수(p)와 뉴런 수(q)를 기반으로 총 게이트 수, 다이 면적, 계산 시간, 전력 소비를 모델링하기 위한 특성 방정식(식 3 및 식 4) 수립.
  • Synopsys 도구와 45 nm CMOS 표준 셀 라이브러리를 사용하여 논리 합성 및 합성 후 평가 수행.
  • MNIST 이미지 처리를 위한 2층 TNN 프로토타입(32M 게이트) 구축. 한 층은 STDP(비지도), 다른 층은 R-STDP(지도) 학습을 적용.
  • 공정 스케일링 파rameters를 사용하여 프로토타입을 7 nm CMOS로 확장하고 성능 및 에너지 지표를 예측.

실험 결과

연구 질문

  • RQ1시간 신경망(TNNs)을 특수 또는 비표준 하드웨어에 의존하지 않고 표준 디지털 CMOS에서 직접적으로 구현할 수 있는가?
  • RQ2계층적 마이크로아키텍처인 뉴런, 컬럼, 층을 설계하여 생물학적으로 타당한 학습을 지원하는 확장 가능한 에너지 효율적 TNN을 구현할 수 있는가?
  • RQ3뉴런 수와 합성원 수에 따라 TNN의 면적, 지연, 전력, 게이트 수의 스케일링 특성은 어떻게 되는가?
  • RQ4CMOS 기반 TNN 프로토타입이 최신 AI 가속기 수준의 실시간, 저전력 감각 처리를 달성할 수 있는가?
  • RQ5TNN에서 행렬 곱셈과 MAC 유닛이 존재하지 않음으로써 에너지 효율성과 하드웨어 확장성에 기여하는 정도는 어느 정도인가?

주요 결과

  • 32M 게이트를 갖는 2층 TNN 프로토타입은 7 nm CMOS에서 28×28 이미지를 107M FPS로 처리하며, 계산 사이클 시간은 9.34 ns이다.
  • 프로토타입은 7 nm CMOS에서 전력 소모가 단지 7.26 mW이며, 다이 면적은 1.54 mm² 뿐이어서 일반 스마트폰 SoC 다이 크기의 2% 미만이다.
  • 뉴런 복잡도는 합성원 가중치(50%)에 의해 주로 결정되며, 이어 STDP(40%)와 뉴런 본체(10%)가 뒤를 이룬다.
  • 컬럼 복잡도는 뉴런 수(q)와 합성원 수(p)의 곱에 거의 선형적으로 비례하며, 핵심 경로 지연은 p에 대해 로그적으로 증가한다.
  • 면적과 전력은 총 합성원 수(p×q)에 선형적으로 비례하지만, 컬럼 내 뉴런 수 q의 영향은 지연에 거의 미치지 못한다.
  • 설계는 빠른 학습 수렴과 MNIST에서 양호한 정확도를 보이며, TNN에서 온라인, 점진적 학습의 실현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.