[论文解读] An Area and Energy Efficient Design of Domain-Wall Memory-Based Deep Convolutional Neural Networks using Stochastic Computing
本论文提出DW-CNN,这是首个针对基于随机计算(SC)和畴壁存储器(DWM)的面积与能效优化的全面优化框架。通过使用高密度、非易失性DWM替代SRAM用于权重存储,并优化内存精度、组织结构与资源共享,该框架在保持高应用级准确率(例如,在1024位随机流下LeNet-5的准确率为99.01%)的同时,将面积减少高达52.6%,功耗降低17.35倍。
With recent trend of wearable devices and Internet of Things (IoTs), it becomes attractive to develop hardware-based deep convolutional neural networks (DCNNs) for embedded applications, which require low power/energy consumptions and small hardware footprints. Recent works demonstrated that the Stochastic Computing (SC) technique can radically simplify the hardware implementation of arithmetic units and has the potential to satisfy the stringent power requirements in embedded devices. However, in these works, the memory design optimization is neglected for weight storage, which will inevitably result in large hardware cost. Moreover, if conventional volatile SRAM or DRAM cells are utilized for weight storage, the weights need to be re-initialized whenever the DCNN platform is re-started. In order to overcome these limitations, in this work we adopt an emerging non-volatile Domain-Wall Memory (DWM), which can achieve ultra-high density, to replace SRAM for weight storage in SC-based DCNNs. We propose DW-CNN, the first comprehensive design optimization framework of DWM-based weight storage method. We derive the optimal memory type, precision, and organization, as well as whether to store binary or stochastic numbers. We present effective resource sharing scheme for DWM-based weight storage in the convolutional and fully-connected layers of SC-based DCNNs to achieve a desirable balance among area, power (energy) consumption, and application-level accuracy.
研究动机与目标
- 解决基于SC的DCNN中内存的高硬件成本与高能耗问题,特别是全连接层中的权重存储问题。
- 通过采用非易失性畴壁存储器(DWM)克服易失性SRAM/DRAM在断电后需重新初始化的局限性。
- 为基于DWM的SC-DCNN权重存储设计一个全面的优化框架,以最小化面积与能耗,同时保持应用级准确率。
- 研究用于DWM中权重表示的最优内存类型、精度、组织结构与数据格式(二进制 vs. 随机流)
- 为卷积层与全连接层中的DWM基权重存储设计有效的资源共享方案,以平衡面积、功耗与准确率。
提出的方法
- 采用高密度、非易失性自旋电子学内存——畴壁存储器(DWM),替代基于SC的DCNN中传统的SRAM用于权重存储。
- 通过评估不同精度水平(如7位二进制、32–1024位随机流)与内存类型,优化内存组织结构,以最小化面积与能耗。
- 在卷积层与全连接层中,为DWM基权重存储实现资源共享方案,以减少冗余电路。
- 利用随机计算(SC)简化算术单元,降低内积与激活函数等计算模块的面积与功耗。
- 在全连接层中,实现多个权重矩阵间DWM读写电路的共享,以最小化面积与能耗开销。
- 基于MNIST数据集,在LeNet-5上评估该框架,硬件参数基于CACTI(SRAM)与Synopsys Design Compiler(逻辑单元)获取,DWM参数来自先前文献。
实验结果
研究问题
- RQ1在面积与能效方面,DWM与SRAM相比,哪种是用于基于SC的DCNN中权重存储的最优内存类型?
- RQ2在基于DWM的SC-DCNN中,将权重存储为二进制数还是随机数,对面积、功耗与应用级准确率的影响如何?
- RQ3在保持高准确率的同时,最小化硬件成本的最优随机权重表示精度(比特流长度)是多少?
- RQ4在全连接层中,DWM基权重存储的资源共享方案在降低面积与功耗方面的有效性如何?
- RQ5基于DWM的权重存储在多大程度上可实现非易失性、即插即用的DCNN平台,从而在断电后无需重新初始化?
主要发现
- 在全连接层中,与非共享DWM配置相比,使用DWM存储权重可将面积减少高达52.6%,功耗降低17.35倍。
- 在DWM中以随机数形式存储权重,相比二进制表示,能更有效地降低面积与功耗,尤其在比特流长度增加时更为显著。
- 即使使用1024位随机权重流,应用级准确率仍保持较高水平(LeNet-5为99.01%),而256位流亦可达到98.95%的准确率,支持采用更短流以提升效率。
- SRAM与长比特流会导致功耗显著上升,而DWM由于其低漏电与高密度特性,功耗几乎保持不变。
- 资源共享方案通过减少DWM读写电路与基于累加器的乘法(APC)模块的数量,有效降低了面积与功耗。
- DWM实现了非易失性权重存储,消除了断电后重新初始化的需求,使嵌入式DCNN系统真正实现即插即用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。