QUICK REVIEW
[论文解读] A Coupled CMOS Oscillator Array for 8ns and 55pJ Inference in Convolutional Neural Networks
Dmitri E. Nikonov, Peter Kurahashi|arXiv (Cornell University)|Oct 25, 2019
Advanced Memory and Neural Computing参考文献 8被引用 6
一句话总结
本文提出了一种耦合CMOS振荡器阵列,通过将输入数据编码为26个环形振荡器的频率偏移,并利用振荡器同步计算点积,在8ns内完成卷积神经网络(CNN)推理,每轮推理消耗55pJ能量。该系统通过使用锁相振荡器在模拟域进行计算,实现了超低延迟和超高能效,证明了同步程度与点积值之间具有高度相关性。
ABSTRACT
Oscillator neural networks (ONN) based on arrays of 26 CMOS ring oscillators designed and fabricated. ONN are used for inference of dot products with image fragments and kernels necessary for convolutional neural networks. The inputs are encoded as frequency shifts of oscillators using current DACs. Degree of match (DOM) is determined from oscillators synchronization. Measurements demonstrate high correlation of DOM and dot products. Inference requires the time of 8ns and energy of 55pJ.
研究动机与目标
- 开发一种高度能效且低延迟的卷积神经网络推理硬件加速器。
- 探索使用耦合CMOS振荡器在模拟域中执行CNN点积运算的方法。
- 通过可扩展的振荡器阵列架构,实现10ns以下的推理时间与100pJ以下的能量消耗。
- 在硬件实现中验证振荡器同步程度(匹配度)与计算点积值之间的相关性。
提出的方法
- 该系统采用由26个CMOS环形振荡器组成的阵列,每个振荡器通过电流DAC接收输入信号,以引起频率偏移。
- 输入数据(图像片段和卷积核)被编码为各振荡器中的电流控制频率偏移。
- 通过耦合振荡器的同步状态提取输入模式与卷积核权重之间的匹配度(DOM, Degree of Match)。
- 通过振荡器之间的相互耦合实现同步,其中锁相状态对应于高点积值。
- 系统将推理时间定义为达到稳定同步所需的时间,该时间点即为最终推理结果。
- 该架构利用模拟计算避免数字算术运算,从而降低能量消耗和延迟。
实验结果
研究问题
- RQ1耦合的CMOS环形振荡器阵列是否能在模拟域中对CNN推理实现准确的点积运算?
- RQ2基于振荡器的神经网络加速器可实现的推理延迟和能效是多少?
- RQ3在硬件实现中,振荡器同步程度与实际点积值之间的相关性如何?
- RQ4频率调制的输入能否被有效映射到振荡器状态,以实现CNN中的模式匹配?
主要发现
- 系统实现了8ns的推理时间,证明了CNN推理可实现10ns以下的运行速度。
- 每轮推理的能量消耗测量值为55pJ,实现了超低功耗运行。
- 观察到振荡器同步程度与计算点积值之间存在强烈相关性。
- 硬件实现成功将图像片段和卷积核输入映射为频率偏移,并通过同步检测匹配结果。
- 该振荡器阵列证明了利用模拟信号处理实现高速、低功耗CNN推理的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。