Skip to main content
QUICK REVIEW

[论文解读] Group Scissor: Scaling Neuromorphic Computing Design to Large Neural Networks

Yandan Wang, Wei Wen|arXiv (Cornell University)|Feb 11, 2017
Advanced Memory and Neural Computing被引用 7
一句话总结

本文提出 Group Scissor,一种两步框架,通过减少交叉条面积和路由拥塞,实现大规模神经网络的类脑计算系统(NCS)扩展。等级剪枝利用低秩逼近缩小权重矩阵,而分组连接删除则结构化地剪除整个连接组,使 LeNet 中交叉条面积减少 13.62%、路由面积减少 8.1%,且无精度损失;在 ConvNet 中分别实现 51.81% 和 52.06% 的减少。

ABSTRACT

Synapse crossbar is an elementary structure in Neuromorphic Computing Systems (NCS). However, the limited size of crossbars and heavy routing congestion impedes the NCS implementations of big neural networks. In this paper, we propose a two-step framework (namely, group scissor) to scale NCS designs to big neural networks. The first step is rank clipping, which integrates low-rank approximation into the training to reduce total crossbar area. The second step is group connection deletion, which structurally prunes connections to reduce routing congestion between crossbars. Tested on convolutional neural networks of LeNet on MNIST database and ConvNet on CIFAR-10 database, our experiments show significant reduction of crossbar area and routing area in NCS designs. Without accuracy loss, rank clipping reduces total crossbar area to 13.62\% and 51.81\% in the NCS designs of LeNet and ConvNet, respectively. Following rank clipping, group connection deletion further reduces the routing area of LeNet and ConvNet to 8.1\% and 52.06\%, respectively.

研究动机与目标

  • 解决类脑计算系统(NCS)在实现大规模深度神经网络(DNN)时的可扩展性限制。
  • 克服因交叉条尺寸受限和 NCS 设计中严重路由拥塞导致的硬件瓶颈。
  • 开发一种软硬件协同设计框架,实现现代 DNN 在 NCS 上的高效、准确且可扩展的部署。
  • 在不牺牲模型精度的前提下,显著降低交叉条和路由面积。

提出的方法

  • 以分组方式对权重矩阵应用低秩逼近(LRA),通过降低秩 K 将每个矩阵 W ≈ U·V^T 进行近似,以最小化交叉条尺寸。
  • 将等级剪枝集成到训练过程中,以在减少所需突触交叉条数量的同时保持模型精度。
  • 通过在整组连接上应用组 Lasso 正则化,实现分组连接删除,从而在权重矩阵中引入结构化稀疏性。
  • 采用分层的 MBC(基于忆阻器的交叉条)选择策略:对尺寸 ≤64×64 的矩阵使用单个 MBC,对更大矩阵则通过拼接多个 MBC 实现,确保硬件可行性。
  • 基于 MBC 尺寸和导线数量,使用数学公式估算交叉条和路由面积,其中路由面积作为剩余导线数的函数进行计算。
  • 通过允许在剪枝后所有列/行均变为零时整体移除交叉条,并用更小的密集交叉条替换稀疏交叉条,优化硬件效率。

实验结果

研究问题

  • RQ1低秩逼近能否有效集成到训练过程中,在不造成精度下降的前提下减少类脑硬件中的交叉条面积?
  • RQ2通过分组连接删除实现的结构化剪枝,能否显著降低大规模 DNN 中交叉条之间的路由拥塞?
  • RQ3在保持模型精度的前提下,联合的 Group Scissor 框架在多大程度上可减少总硬件面积(交叉条 + 路由)?
  • RQ4在标准基准(MNIST、CIFAR-10)和硬件感知约束下,该框架在真实世界 DNN(如 LeNet 和 ConvNet)上的表现如何?

主要发现

  • 等级剪枝使 LeNet 的总交叉条面积减少至原始值的 13.62%,ConvNet 中减少至 51.81%,且无精度损失。
  • 分组连接删除使 LeNet 的平均逐层路由面积减少至 8.1%,ConvNet 中减少至 52.06%,同时保持基线精度。
  • 在仅损失 1.5% 精度的情况下,LeNet 各层的路由面积分别减少至 56.25%、7.64%、21.44% 和 31.64%,表明在适度精度折衷下具备强大可扩展性。
  • 分组剪枝引入的结构化稀疏性使得整个交叉条可被移除,并可替换为更小的密集交叉条,进一步降低面积。
  • 分组连接删除后,权重矩阵呈现出分块稀疏性,整个列/行被置零,从而可消除相应路由导线。
  • 该框架实现了显著的硬件面积节省——LeNet 中路由面积最高减少 92%,同时在 MNIST 和 CIFAR-10 上保持了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。