Skip to main content
QUICK REVIEW

[论文解读] 5 Parallel Prism: A topology for pipelined implementations of convolutional neural networks using computational memory

Martino Dazzi, Abu Sebastian|arXiv (Cornell University)|Jun 8, 2019
Advanced Memory and Neural Computing参考文献 22被引用 8
一句话总结

本文提出5平行棱柱(5PP)拓扑结构,一种面向计算内存阵列的通信结构,可实现卷积神经网络(CNN)的流水线推理,且延迟和带宽开销极低。通过证明CNN图表示与5PP之间的同态关系,作者展示了所有主流CNN架构——包括ResNet、Inception和DenseNet——均可高效映射,实现最高7倍的延迟降低和每通道4倍的带宽减少,相较于二维网格结构。

ABSTRACT

In-memory computing is an emerging computing paradigm that could enable deeplearning inference at significantly higher energy efficiency and reduced latency. The essential idea is to map the synaptic weights corresponding to each layer to one or more computational memory (CM) cores. During inference, these cores perform the associated matrix-vector multiply operations in place with O(1) time complexity, thus obviating the need to move the synaptic weights to an additional processing unit. Moreover, this architecture could enable the execution of these networks in a highly pipelined fashion. However, a key challenge is to design an efficient communication fabric for the CM cores. Here, we present one such communication fabric based on a graph topology that is well suited for the widely successful convolutional neural networks (CNNs). We show that this communication fabric facilitates the pipelined execution of all state of-the-art CNNs by proving the existence of a homomorphism between one graph representation of these networks and the proposed graph topology. We then present a quantitative comparison with established communication topologies and show that our proposed topology achieves the lowest bandwidth requirements per communication channel. Finally, we present a concrete example of mapping ResNet-32 onto an array of CM cores.

研究动机与目标

  • 解决计算内存(CM)核心间通信效率低下导致的流水线CNN推理瓶颈问题。
  • 设计一种通信结构拓扑,支持多样化、最先进的CNN架构,且不引入冗余连接。
  • 最小化基于CM的DNN加速器中每条通信通道的延迟和带宽需求。
  • 从理论上证明所有主流CNN架构(前馈型、残差型、Inception型、密集连接型)均可映射到所提出的5PP拓扑上。

提出的方法

  • 提出一种新型基于图的通信拓扑结构,称为5平行棱柱(5PP),专为计算内存阵列中的物理邻近性和流水线执行而优化。
  • 定义CNN的统一图表示,其中顶点代表层,边代表激活张量流动,从而支持对网络可执行性的形式化分析。
  • 建立流水线执行的数学条件:即CNN的图表示到5PP拓扑之间存在图同态。
  • 利用同态存在的理论标准,证明ResNet、Inception和DenseNet可映射到5PP上。
  • 通过延迟、吞吐量和每通道带宽等指标,定量比较5PP与二维网格拓扑的性能。
  • 提供在4×10 CM核心阵列上对ResNet-32的详细物理映射,明确数据流、内存使用和带宽需求。

实验结果

研究问题

  • RQ1能否设计一种通信拓扑,使所有主流CNN架构在计算内存阵列上实现流水线推理?
  • RQ2何种拓扑特性是通信结构支持低延迟、高吞吐量执行多样化CNN的必要且充分条件?
  • RQ35PP拓扑相较于2D网格等成熟拓扑,在延迟和带宽效率方面表现如何?
  • RQ4是否存在一种形式化标准,用于判断给定CNN是否可在特定通信结构上无流水线停顿地执行?
  • RQ5使用5PP拓扑将ResNet-32映射到CM阵列时,实际的内存和带宽需求是多少?

主要发现

  • 5PP拓扑通过证明其与CNN图表示之间存在同态关系,实现了对所有先进CNN架构(包括ResNet、Inception和DenseNet)的流水线执行。
  • 与最优的2D网格配置相比,5PP拓扑将推理延迟降低最多7倍,每通道带宽需求减少最多4倍。
  • 5PP中的互连数量相比2D网格增加了2.31倍,远低于延迟提升7倍和带宽效率提升4倍的收益,表明其具有显著的性价比优势。
  • 在4×10 CM核心阵列上对ResNet-32的映射中,所提拓扑确保无流水线停顿,每通道所需带宽估计约为5 Gbps,处于当前先进片上链路能力范围内。
  • 对ResNet-32在CM核心上的物理映射表明,前馈路径和残差路径的激活张量可通过独立通道传输,实现高效数据流且开销极小。
  • 基于图同态的理论框架为验证任意CNN架构在给定通信结构上的可映射性提供了一般性方法,可支持未来加速器的系统化设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。