[论文解读] Precise neural network computation with imprecise analog devices
本文提出了一种框架,通过在训练过程中将实测的硬件非理想性作为约束条件,使深度神经网络能够补偿模拟VLSI电路中的器件失配问题。该方法可在低功耗、紧凑的模拟电路中实现精确的神经网络推理,性能与理想数字实现相当,同时显著降低功耗。
The operations used for neural network computation map favorably onto simple analog circuits, which outshine their digital counterparts in terms of compactness and efficiency. Nevertheless, such implementations have been largely supplanted by digital designs, partly because of device mismatch effects due to material and fabrication imperfections. We propose a framework that exploits the power of deep learning to compensate for this mismatch by incorporating the measured device variations as constraints in the neural network training process. This eliminates the need for mismatch minimization strategies and allows circuit complexity and power-consumption to be reduced to a minimum. Our results, based on large-scale simulations as well as a prototype VLSI chip implementation indicate a processing efficiency comparable to current state-of-art digital implementations. This method is suitable for future technology based on nanodevices with large variability, such as memristive arrays.
研究动机与目标
- 解决模拟VLSI电路中器件失配的问题,尽管其在面积和功耗效率方面具有优势,但历史上该问题限制了其广泛应用。
- 通过在神经网络训练过程中利用实测的器件特性,实现在模拟硬件上的高精度神经网络推理。
- 通过避免传统失配抑制技术(如使用大尺寸晶体管)来降低电路复杂度和功耗。
- 通过大规模仿真和一款180 nm CMOS VLSI原型的实现,证明了该方法在实时分类任务中的可行性。
- 为适用于边缘设备和能效受限应用的可扩展、超低功耗模拟神经网络处理器铺平道路。
提出的方法
- 使用受控输入激励和输出记录,对已制造的VLSI芯片上的单个模拟神经元的传输特性进行测量。
- 将实测的器件响应曲线作为联合训练过程中网络权重与电路参数的约束条件。
- 通过使用实测器件行为的离线训练,生成针对特定硬件非理想性的配置参数。
- 将优化后的网络参数映射回物理模拟电路,实现完全硬件配置的神经网络。
- 采用紧凑、低功耗的模拟电路设计,执行基本运算(例如,通过导线连接实现加法,通过双晶体管结构实现乘法)。
- 通过行为级仿真和闭环VLSI原型验证该框架,使用真实器件测量数据进行网络的训练与测试。
实验结果
研究问题
- RQ1是否可以利用深度学习在无需硬件均匀性的前提下,补偿模拟VLSI神经网络实现中的器件失配?
- RQ2模拟VLSI电路在功耗和面积更优的前提下,能在多大程度上实现与理想数字实现相当的性能?
- RQ3在训练过程中引入实测硬件响应曲线,对真实模拟系统中的分类准确率和鲁棒性有何影响?
- RQ4该框架是否可扩展至其他高变异性的基底材料,如阻变存储器阵列或纳米尺度器件?
- RQ5收敛时间变化对能效的影响如何?是否可通过自适应输入电流控制加以缓解?
主要发现
- 该模拟VLSI实现利用实测器件特性与硬件优化训练,在Iris花数据集上实现了100%的分类准确率。
- 在MNIST数据集上,模拟的模拟电路实现了98.0%的准确率,与理想数字网络性能相当。
- 该模拟实现的能效达到7.97 TOp/J,优于数字基线的6.39 TOp/J。
- 大规模SPICE仿真表明,即使在使用测试数据子集的情况下,训练后的模拟网络仍保持94.6%的高准确率。
- 该框架实现了完全并行、内存与计算共置的架构,消除了神经网络推理中的冯·诺依曼瓶颈。
- 该方法具有可扩展性,适用于其他可变精度的基底材料,包括未来具有高制造变异性的阻变存储器和纳米尺度器件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。