Skip to main content
QUICK REVIEW

[論文レビュー] Automated Design Space Exploration of CGRA Processing Element Architectures using Frequent Subgraph Analysis

Jackson Melchert, Kathleen Feng|arXiv (Cornell University)|Apr 29, 2021
Embedded Systems Design Techniques参考文献 16被引用数 5
ひとこと要約

本論文は、アプリケーションから共通する計算パターンを抽出するための頻出部分グラフ解析を用いて、粗粒度再構成可能アレイ(CGRA)プロセッシングエレメント(PE)の自動設計空間探索フレームワークを提示する。これらの部分グラフを統合することで、ベースラインPEと比較して最大10.5倍のエネルギー効率向上と9.1倍の面積削減を達成する専用PEを生成する。この手法により、画像処理および機械学習ワークロードにおける性能と効率が顕著に向上する。

ABSTRACT

The architecture of a coarse-grained reconfigurable array (CGRA) processing element (PE) has a significant effect on the performance and energy efficiency of an application running on the CGRA. This paper presents an automated approach for generating specialized PE architectures for an application or an application domain. Frequent subgraphs mined from a set of applications are merged to form a PE architecture specialized to that application domain. For the image processing and machine learning domains, we generate specialized PEs that are up to 10.5x more energy efficient and consume 9.1x less area than a baseline PE.

研究の動機と目的

  • 特定のアプリケーションドメイン向けに高効率なCGRA PEを手動で設計する課題に対処すること。
  • 膨大なCGRA PEアーキテクチャ空間を探索するために必要な設計のオーバーヘッドと時間を削減すること。
  • 面積、エネルギー、パフォーマンスの最適化を図る専用PEの自動生成を可能にすること。
  • 複数のワークロードにわたる一般性と効率のバランスを取るためのクロスアプリケーションPE特化を支援すること。
  • ハードウェア生成とコンパイラ合成を統合した包括的で迅速なツールチェーンを提供し、エンドツーエンドの評価を可能にすること。

提案手法

  • ドメイン(例:画像処理や機械学習)における代表的なアプリケーション群から共通する計算部分グラフを抽出するために頻出部分グラフマイニングを適用する。
  • 頻出度の高い部分グラフを統合し、対象アプリケーションに共通する主要な演算をサポートする統合型PEアーキテクチャを構築する。
  • 統合された部分グラフ構造をテンプレートとして用い、最適化された算術ユニットとイントラコネクトルーティングを備えた専用PEを生成する。
  • PEと統合されたインタコネクトおよび構成論理を含む、完全なCGRAアーキテクチャを自動生成する。
  • 生成されたCGRAにアプリケーションをマップするために、専用PEの命令セットを用いたドメイン特化コンパイラを自動生成する。
  • サイクル単位のシミュレーションおよび合成ツールを用いて、面積、エネルギー、パフォーマンスといった複数の指標で、得られたCGRA設計を評価する。

実験結果

リサーチクエスチョン

  • RQ1頻出部分グラフ解析を用いることで、ドメイン内のアプリケーション間で共通する計算パターンをどのように同定できるか?
  • RQ2頻出部分グラフを統合することで、複数のアプリケーションにわたる効率性と一般性のバランスを取ったPEアーキテクチャをどの程度達成できるか?
  • RQ3一般向けベースラインPEと比較して、専用PEは面積およびエネルギー効率でどの程度の向上を達成するか?
  • RQ4アプリケーション特化型PEとクロスアプリケーション特化型PEは、パフォーマンスおよびリソース使用量の観点で、それぞれどのように異なるか?
  • RQ5提案されたフレームワークは、最小限の手作業でCGRAおよびコンパイラスタックを生成可能であり、ASICに近い効率性を達成できるか?

主な発見

  • 画像処理分野では、専用PEがベースラインPEと比較して最大10.5倍のエネルギー効率向上と9.1倍の面積削減を達成した。
  • カメラパイプライン向けに特化したPEは、ベースラインと比較して最大8.3倍のエネルギー削減と3.4倍の面積削減を達成した。
  • 専用PEの最大動作周波数は、ベースラインの1.43 GHzから2 GHzに向上し、タイミングおよびパフォーマンスの向上を示した。
  • 一般化された画像処理PE(PE IP)は、4つの画像処理アプリケーションにおいて、面積が29.6–32.5%低減され、エネルギーが44.5–65.25%低減された。
  • 特定アプリケーション向けに特化したPE(例:ラプラシアンピラミッド用)は、一般化されたPE IPと比較して、面積が38.6%低減、エネルギーが33.0%低減された。これは、単一アプリケーションに特化することの利点を示している。
  • 機械学習分野では、一般化されたML PE(PE ML)は、ベースラインと比較して最大60.15%のエネルギー削減を達成し、ベースラインCGRAと比較して22.1%の全体的なエネルギー低減を達成した。これは、Simbaのようなカスタムアクセラレータに近い効率性を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。