Skip to main content
QUICK REVIEW

[論文レビュー] 5 Parallel Prism: A topology for pipelined implementations of convolutional neural networks using computational memory

Martino Dazzi, Abu Sebastian|arXiv (Cornell University)|Jun 8, 2019
Advanced Memory and Neural Computing参考文献 22被引用数 8
ひとこと要約

本稿では、計算メモリアレイにおけるパイプライン型推論を可能にする通信ファブリックとして、5 Parallel Prism (5PP)トポロジーを提案する。この手法により、最小限の遅延および帯域幅オーバーヘッドで畳み込みニューラルネットワーク (CNN) のパイプライン型推論が実現される。CNNのグラフ表現と5PPとの間のホモモーフィズムの存在を示すことで、ResNet、Inception、DenseNetを含む主なCNNアーキテクチャが効率的にマッピング可能であることを実証し、2Dメッシュと比較して最大7倍の遅延低減および1チャンネルあたり4倍の帯域幅削減を達成する。

ABSTRACT

In-memory computing is an emerging computing paradigm that could enable deeplearning inference at significantly higher energy efficiency and reduced latency. The essential idea is to map the synaptic weights corresponding to each layer to one or more computational memory (CM) cores. During inference, these cores perform the associated matrix-vector multiply operations in place with O(1) time complexity, thus obviating the need to move the synaptic weights to an additional processing unit. Moreover, this architecture could enable the execution of these networks in a highly pipelined fashion. However, a key challenge is to design an efficient communication fabric for the CM cores. Here, we present one such communication fabric based on a graph topology that is well suited for the widely successful convolutional neural networks (CNNs). We show that this communication fabric facilitates the pipelined execution of all state of-the-art CNNs by proving the existence of a homomorphism between one graph representation of these networks and the proposed graph topology. We then present a quantitative comparison with established communication topologies and show that our proposed topology achieves the lowest bandwidth requirements per communication channel. Finally, we present a concrete example of mapping ResNet-32 onto an array of CM cores.

研究の動機と目的

  • 計算メモリ (CM) コア間の非効率な通信が原因で生じるパイプライン型CNN推論のボトルネックを解消すること。
  • 多様で最新のCNNアーキテクチャをサポートするが、余分な接続を追加しない通信ファブリックトポロジーを設計すること。
  • CMベースのDNNアクセラレータにおける通信チャネルごとの遅延および帯域幅要件を最小限に抑えること。
  • すべての主要なCNNアーキテクチャ(順方向伝搬、残差接続、Inception、密集接続)が提案された5PPトポロジーへマッピング可能であることを理論的に証明すること。

提案手法

  • 計算メモリアレイにおける物理的近接性とパイプライン実行を最適化した、新しいグラフベースの通信トポロジー「5 Parallel Prism (5PP)」を提案する。
  • 頂点が層を、辺が活性化値の流れを表す統合的グラフ表現を定義し、ネットワーク実行可能性の形式的解析を可能にする。
  • パイプライン実行のための数学的条件を確立する:CNNのグラフ表現から5PPトポロジーへのグラフホモモーフィズムの存在。
  • ホモモーフィズムの存在を理論的基準として用い、ResNet、Inception、DenseNetが5PPへマッピング可能であることを証明する。
  • 遅延、スループット、1チャンネルあたりの帯域幅といった指標を用いて、5PPと2Dメッシュトポロジーを定量的に比較する。
  • 4×10のCMコアアレイ上へのResNet-32の詳細な物理的マッピングを提示し、データフロー、メモリ使用量、帯域幅要件を明示する。

実験結果

リサーチクエスチョン

  • RQ1計算メモリアレイ上でのすべての主要なCNNアーキテクチャのパイプライン型推論を可能にする通信トポロジーを設計できるか?
  • RQ2多様なCNNの低遅延・高スループット実行をサポートする通信ファブリックに必要な、十分なトポロジカル性質は何か?
  • RQ35PPトポロジーは、2Dメッシュなどの既存トポロジーと比較して、遅延および帯域幅効率においてどのように優れているか?
  • RQ4与えられた通信ファブリック上でパイプラインスタールなしに実行可能な与えられたCNNを判定する形式的基準は存在するか?
  • RQ55PPトポロジーを用いてCMアレイ上にResNet-32をマッピングする際の実用的メモリおよび帯域幅要件は何か?

主な発見

  • 5PPトポロジーは、CNNのグラフ表現と5PPトポロジーとの間のホモモーフィズムの存在を示すことで、ResNet、Inception、DenseNetを含むすべての最新のCNNアーキテクチャのパイプライン実行を可能にする。
  • 2Dメッシュの最良な構成と比較して、5PPトポロジーは推論遅延を最大7倍低減し、1チャンネルあたりの帯域幅要件を最大4倍削減する。
  • 5PPの接続数は2Dメッシュと比較して2.31倍に増加するが、これは遅延の7倍改善および帯域幅効率の4倍改善と比較すると顕著に低い増加率である。
  • 4×10のCMコアアレイ上へのResNet-32マッピングにおいて、提案されたトポロジーはパイプラインスタールを発生させず、1チャンネルあたりの必要帯域幅は約5 Gbpsと推定される。これは最新のオンチップリンク性能範囲内に収まる。
  • CMコア上へのResNet-32の物理的マッピングにより、順方向伝搬パスと残差パスの活性化値が別々のチャネルで通信可能であることが示され、最小限のオーバーヘッドで効率的なデータフローが実現可能である。
  • グラフホモモーフィズムに基づく理論的枠組みは、任意のCNNアーキテクチャが与えられた通信ファブリックへマッピング可能かどうかを検証する一般化された手法を提供し、将来のアクセラレータの体系的設計を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。