[논문 리뷰] Non-volatile Hierarchical Temporal Memory: Hardware for Spatial Pooling
이 논문은 하이퍼터미널 메모리(HTM)의 스페이셜 풀러에 대한 비버니셔블 하드웨어 아키텍처를 제안하며, 스케일러블하고 저전력인 메모리 내 연산을 가능하게 하기 위해 플래시 메모리를 활용한다. 행동 모델을 통해 MNIST에서 91.98%의 정확도를 달성하였으며, TSMC 180nm 공정에서 30.538mm²의 레이아웃과 64.394mW의 전력 소모를 통해 실현 가능성을 입증하여, 뉴로모르픽 시스템의 저장-처리 공동 설계를 검증한다.
Hierarchical Temporal Memory (HTM) is a biomimetic machine learning algorithm imbibing the structural and algorithmic properties of the neocortex. Two main functional components of HTM that enable spatio-temporal processing are the spatial pooler and temporal memory. In this research, we explore a scalable hardware realization of the spatial pooler closely coupled with the mathematical formulation of spatial pooler. This class of neuromorphic algorithms are advantageous in solving a subset of the future engineering problems by extracting nonintuitive patterns in complex data. The proposed architecture, Non-volatile HTM (NVHTM), leverages large-scale solid state flash memory to realize a optimal memory organization, area and power envelope. A behavioral model of NVHTM is evaluated against the MNIST dataset, yielding 91.98% classification accuracy. A full custom layout is developed to validate the design in a TSMC 180nm process. The area and power profile of the spatial pooler are 30.538mm2 and 64.394mW, respectively. This design is a proof-of-concept that storage processing is a viable platform for large scale HTM network models.
연구 동기 및 목표
- HTM 스페이셜 풀러의 스케일러블하고 저전력인 하드웨어 구현이 부족한 문제를 해결하기 위해.
- 플래시 메모리의 확장성과 에너지 효율성 덕분에, DRAM 대신 비버니셔블 메모리(NVM) 중심 아키텍처를 HTM에 적용할 수 있는 가능성을 탐색하기 위해.
- SSD 내부에 처리 및 저장 기능을 공동 배치하여 메모리 내 연산을 실현함으로써 데이터 이동을 줄이고 병렬성을 향상시키기 위해.
- TSMC 180nm 공정에서 전체 맞춤형 레이아웃을 사용하여 면적, 전력, 성능 추정을 통해 설계의 실현 가능성을 검증하기 위해.
- 향후 PCM 또는 메모리스터와 같은 새로운 NVM 기술과 결합할 수 있도록, 이론적 기반을 마련하고 시간 기억 구성 요소로의 확장 가능성을 모색하기 위해.
제안 방법
- 스패티얼 풀러는 전용 하드웨어 블록으로 구성된 파ipel라인 아키텍처로 구현되며, OVPipe(중첩 연산), WBPipe(윈로잉), 그리고 영구성 값과 입력 시냅스를 저장하기 위한 플래시 메모리 기반 메모리 계층을 포함한다.
- 메모리 매핑 기반 구성 모델을 사용하여, 주소 지정 가능한 플래시 어레이를 통해 시냅스 가중치와 상태 변수에 직접 액세스함으로써 외부 메모리로의 데이터 이동을 최소화한다.
- MNIST 데이터셋을 사용하여 행동 모델을 개발하고 평가하였으며, HTM 성능 평가를 위해 외부 SVM을 사용하여 분류를 수행하였다.
- TSMC 180nm에서 전체 맞춤형 레이아웃을 합성하였으며, 파라사이트식 추출 및 Eldo 시뮬레이션을 통해 구성 요소의 전력 소모를 추정하였다.
- 채널 기반 조직 방식을 채택하였으며, 면적과 전력은 채널 단위로 추정하고 OVPipe, WBPipe 및 보조 구성 요소를 포함한 모듈식 공식을 사용하여 집계하였다.
- 확장성에 유리하게 설계되었으며, 향후 PCM 또는 저항성 램과 같은 신개념 NVM에 대응할 수 있도록 SSD 내부에 저장-처리 유닛(SPU)으로 통합 가능하다.
실험 결과
연구 질문
- RQ1비버니셔블 플래시 기반 하드웨어 아키텍처가 면적과 전력 소모의 허용 가능한 오버헤드를 유지하면서 HTM의 스페이셜 풀러 기능을 효과적으로 구현할 수 있는가?
- RQ2NVM 기반 스페이셜 풀러의 성능은 정확도와 지연 시간 측면에서 소프트웨어 또는 DRAM 기반 구현과 비교해 볼 때 어떻게 다른가?
- RQ3표준 공정인 180nm 공정에서 스케일러블한 HTM 스페이셜 풀러를 위한 전체 맞춤형 CMOS 레이아웃의 면적과 전력 프로파일은 어떠한가?
- RQ4플래시 메모리 내 연산을 통해 데이터 이동을 얼마나 줄이고 병렬성을 얼마나 향상시킬 수 있는가?
- RQ5이 설계는 온라인 학습을 지원하고 향후 PCM 또는 메모리스터와 같은 새로운 NVM 기술로 확장 가능한가?
주요 결과
- NVHTM 스페이셜 풀러의 행동 모델은 외부 SVM과 조합하여 MNIST 데이터셋에서 91.98%의 분류 정확도를 달성하였으며, 기존 HTM 구현 대비 경쟁력 있는 성능을 입증하였다.
- TSMC 180nm 공정에서의 전체 맞춤형 레이아웃은 면적 30.538mm²를 차지하며 총 전력 소모는 64.394mW로, SSD 기반 시스템에 통합 가능한 실현 가능성을 입증하였다.
- OVPipe와 WBPipe 구성 요소가 메모리 요소의 높은 스위칭 활동으로 인해 전력 소모의 주요 원인으로 밝혀졌으며, 평균 전력 소모는 각각 5.171mW였다.
- 고도로 병렬화된 아키텍처를 구현하여 주 CPU 자원 의존도를 낮추었으며, 기업 규모의 데이터 처리 환경에서의 확장 가능한 배포를 가능하게 하였다.
- NVHTM 파이프라인에 의해 유도되는 지연 시간은 기준 SSD 액세스 지연 시간보다 수 개월 정도 작아, SSD의 본질적 지연에도 불구하고 인라인 처리가 실현 가능하다는 것을 보여주었다.
- 아키텍처는 확장 가능하고 확장성이 있으며, 재구성 가능한 플랫폼에 통합할 수 있고, 동적 프루닝 및 시간 분할 기법을 활용하여 시간 기억 구성 요소로의 확장도 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.