Skip to main content
QUICK REVIEW

[论文解读] A 481pJ/decision 3.4M decision/s Multifunctional Deep In-memory Inference Processor using Standard 6T SRAM Array

Mingu Kang, Sujan K. Gonugondla|arXiv (Cornell University)|Oct 24, 2016
Advanced Memory and Neural ComputingEngineering参考文献 3被引用 22
一句话总结

该论文提出了一款65 nm CMOS 16KB标准6T SRAM架构的深度内存推理处理器,可在每秒340万次决策下实现每决策481 pJ的能效,相较于传统架构实现最高5.6倍的能效提升,且在四种应用(SVM、匹配滤波器、模板匹配、KNN)中精度损失不超过1%。该处理器通过在SRAM位元单元阵列中实现针脚匹配的模拟处理,采用子范围多行功能读取、可重构位线与交叉位线处理,以及低摆幅电荷共享计算,消除了片外数据移动,从而实现高能效。

ABSTRACT

This paper describes a multi-functional deep in-memory processor for inference applications. Deep in-memory processing is achieved by embedding pitch-matched low-SNR analog processing into a standard 6T 16KB SRAM array in 65 nm CMOS. Four applications are demonstrated. The prototype achieves up to 5.6X (9.7X estimated for multi-bank scenario) energy savings with negligible (<1%) accuracy degradation in all four applications as compared to the conventional architecture.

研究动机与目标

  • 通过在SRAM阵列中直接嵌入模拟计算,解决传统深度学习推理架构中高能耗与内存带宽瓶颈的问题。
  • 在不改变存储密度或读写功能的前提下,实现单个标准6T SRAM阵列内的多功能推理(点积、曼哈顿距离、分类)。
  • 通过利用子范围多行功能读取和电荷共享计算实现大规模并行内存内处理,以实现高能效与高吞吐量。
  • 通过减少读取周期和在片上执行模拟操作,实现内存访问能耗的降低,同时保持精度损失可忽略(<1%)。

提出的方法

  • 使用脉宽调制字线(PWM-WL)信号执行多行功能读取(MR-FR),在单个预充电周期内实现多行上的加权和计算。
  • 通过将8位字拆分为4个最高有效位(MSB)和4个最低有效位(LSB)列,采用电荷共享(1/16比例)在列间距限制内实现高分辨率模拟计算。
  • 通过模拟多路复用器和比较器,重新配置位线处理(BLP)和交叉位线处理(CBLP)级,以在点积(DP)或曼哈顿距离(MD)模式下运行。
  • 采用混合信号电容乘法器,通过逐位处理实现,同时利用并行4位MSB/LSB乘法器提升吞吐量。
  • 集成数字控制器与流水线架构,实现预充电与处理的并行操作,支持每周期128×8位字访问。
  • 采用低速、高能效的单斜率ADC,通过在两个连续CBLP输出之间共享电荷,降低功耗。

实验结果

研究问题

  • RQ1标准6T SRAM阵列是否可扩展用于多功能深度内存内推理,而无需修改其存储或读写功能?
  • RQ2如何在保持针脚匹配与线性度的前提下,将模拟计算嵌入SRAM位元单元阵列,且在工艺与工艺变化下保持稳定?
  • RQ3通过在SRAM阵列中执行片上计算以减少内存访问周期,能效提升的幅度有多大?
  • RQ4在65 nm CMOS工艺中,采用低摆幅电荷共享模拟计算时,精度与能效之间的权衡如何?
  • RQ5同一硬件是否可通过可重构处理级支持多种推理工作负载(如SVM、KNN、模板匹配)?

主要发现

  • 该原型在每秒340万次决策下实现481 pJ/决策的能效,相较于传统架构最高实现5.6倍能效提升,且在所有四种应用中精度损失不超过1%。
  • 由于采用子范围多行功能读取,芯片将内存访问能耗降低了16倍,每访问周期处理128×8位字,而非通过列多路复用的8×8位字。
  • 子范围MR-FR的实测最大积分非线性度(INL)为0.03 LSB,确保了模拟到数字转换的高线性度。
  • 在DP模式下,最大误差幅值为输出动态范围的5.8%;在MD模式下为8.6%。
  • 能效分解显示,MR-FR阶段对能效提升贡献最大,ΔVBL每降低20 mV,核心能耗减少0.2 pJ。
  • 在多bank场景下,估算能效提升可达9.7倍(DP模式)和5.4倍(MD模式),控制器能耗可分摊至多个bank。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。