[论文解读] Non-volatile Hierarchical Temporal Memory: Hardware for Spatial Pooling
该论文提出了一种用于层次时间记忆(HTM)中空间池化的非易失性硬件架构,利用闪存实现可扩展、低功耗的内存内计算。该设计在行为模型下于MNIST数据集上实现了91.98%的准确率,并通过TSMC 180nm工艺的30.538mm²版图和64.394mW功耗验证了其可行性,证明了存储-处理协同设计在类脑系统中的潜力。
Hierarchical Temporal Memory (HTM) is a biomimetic machine learning algorithm imbibing the structural and algorithmic properties of the neocortex. Two main functional components of HTM that enable spatio-temporal processing are the spatial pooler and temporal memory. In this research, we explore a scalable hardware realization of the spatial pooler closely coupled with the mathematical formulation of spatial pooler. This class of neuromorphic algorithms are advantageous in solving a subset of the future engineering problems by extracting nonintuitive patterns in complex data. The proposed architecture, Non-volatile HTM (NVHTM), leverages large-scale solid state flash memory to realize a optimal memory organization, area and power envelope. A behavioral model of NVHTM is evaluated against the MNIST dataset, yielding 91.98% classification accuracy. A full custom layout is developed to validate the design in a TSMC 180nm process. The area and power profile of the spatial pooler are 30.538mm2 and 64.394mW, respectively. This design is a proof-of-concept that storage processing is a viable platform for large scale HTM network models.
研究动机与目标
- 为解决HTM空间池化在大规模类脑系统中缺乏可扩展、低功耗硬件实现的问题。
- 探索以非易失性存储器(NVM)为中心的架构,作为HTM中传统易失性DRAM的可行替代方案,利用闪存的可扩展性和能效优势。
- 通过在固态硬盘(SSD)中实现处理与存储的共置,支持内存内计算,减少数据移动并提升并行性。
- 通过TSMC 180nm工艺中的全定制版图,对面积、功耗和性能进行估算,验证设计的可行性。
- 为未来扩展至时间记忆组件以及新兴NVM技术(如PCM或忆阻器)奠定基础。
提出的方法
- 空间池化器采用流水线架构,包含专用硬件模块:OVPipe(重叠计算)、WBPipe(筛选)以及基于闪存的存储层次,用于存储突触永久值和输入突触。
- 采用内存映射配置模型,通过可寻址的闪存阵列直接访问突触权重和状态变量,最大限度减少片外数据移动。
- 开发并评估了行为模型,使用MNIST数据集进行测试,分类任务由外部SVM完成,以评估HTM性能。
- 在TSMC 180nm工艺中合成全定制版图,通过寄生参数提取和Eldo仿真估算各组件的功耗。
- 架构采用基于通道的组织方式,按通道估算面积与功耗,并通过包含OVPipe、WBPipe和辅助组件的模块化公式进行聚合。
- 系统设计具备可扩展性,可作为存储处理单元(SPU)集成至SSD中,支持未来在PCM或阻变存储器等新兴NVM上的部署。
实验结果
研究问题
- RQ1基于非易失性闪存的硬件架构能否在可接受的面积和功耗开销下有效实现HTM的空间池化功能?
- RQ2与软件实现或基于DRAM的实现相比,基于NVM的空间池化器在准确率和延迟方面表现如何?
- RQ3在标准工艺(如180nm)下,可扩展HTM空间池化器的全定制CMOS版图的面积与功耗特性如何?
- RQ4在HTM系统中,基于闪存的内存内计算在多大程度上可减少数据移动并提升并行性?
- RQ5该设计是否可扩展以支持在线学习,并适配未来NVM技术(如PCM或忆阻器)?
主要发现
- NVHTM空间池化器的行为模型在与SVM结合时,于MNIST数据集上实现了91.98%的分类准确率,性能与现有HTM实现相比具有竞争力。
- 在TSMC 180nm工艺下的全定制版图面积为30.538mm²,总功耗为64.394mW,表明其具备集成至SSD系统中的可行性。
- OVPipe和WBPipe组件因存储元件中高切换活动而成为主要功耗来源,平均功耗分别为5.171mW。
- 该设计支持高并行性,减少对主机CPU资源的依赖,节省关键系统带宽,适用于企业级数据处理中的可扩展部署。
- NVHTM流水线引入的延迟远低于基线SSD访问延迟,即使在SSD固有延迟下,仍使端到端处理成为可行。
- 该架构具备可扩展性和可扩展性,具备集成至可重构平台的潜力,并可通过动态剪枝和时间复用技术扩展至时间记忆组件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。