Skip to main content
QUICK REVIEW

[論文レビュー] ORIGAMI: A Heterogeneous Split Architecture for In-Memory Acceleration of Learning

Hajar Falahati, Pejman Lotfi-Kamran|arXiv (Cornell University)|Dec 30, 2018
Parallel Computing and Optimization Techniques参考文献 69被引用数 5
ひとこと要約

Origamiは、機械学習ワークロードにおける3Dスタックドメモリの帯域幅、消費電力、面積制限を克服するために、メモリ内アクセラレータと外部コンピューティングプラットフォームを組み合わせた非均質なスプリットアーキテクチャを提案する。共通する計算パターンを専用エンジンに抽出し、メモリ内とメモリ外のプラットフォーム間で知的に計算を分割することで、最先端のアクセラレータ比で最大1.6倍の高速化と31倍のエネルギー遅延積(EDP)の改善を達成する。

ABSTRACT

Memory bandwidth bottleneck is a major challenges in processing machine learning (ML) algorithms. In-memory acceleration has potential to address this problem; however, it needs to address two challenges. First, in-memory accelerator should be general enough to support a large set of different ML algorithms. Second, it should be efficient enough to utilize bandwidth while meeting limited power and area budgets of logic layer of a 3D-stacked memory. We observe that previous work fails to simultaneously address both challenges. We propose ORIGAMI, a heterogeneous set of in-memory accelerators, to support compute demands of different ML algorithms, and also uses an off-the-shelf compute platform (e.g.,FPGA,GPU,TPU,etc.) to utilize bandwidth without violating strict area and power budgets. ORIGAMI offers a pattern-matching technique to identify similar computation patterns of ML algorithms and extracts a compute engine for each pattern. These compute engines constitute heterogeneous accelerators integrated on logic layer of a 3D-stacked memory. Combination of these compute engines can execute any type of ML algorithms. To utilize available bandwidth without violating area and power budgets of logic layer, ORIGAMI comes with a computation-splitting compiler that divides an ML algorithm between in-memory accelerators and an out-of-the-memory platform in a balanced way and with minimum inter-communications. Combination of pattern matching and split execution offers a new design point for acceleration of ML algorithms. Evaluation results across 12 popular ML algorithms show that ORIGAMI outperforms state-of-the-art accelerator with 3D-stacked memory in terms of performance and energy-delay product (EDP) by 1.5x and 29x (up to 1.6x and 31x), respectively. Furthermore, results are within a 1% margin of an ideal system that has unlimited compute resources on logic layer of a 3D-stacked memory.

研究の動機と目的

  • 3Dスタックドメモリを活用して、機械学習トレーニングにおけるメモリ帯域幅のボトルネックを解消すること。
  • 一般性に欠ける、または利用可能な帯域幅を効率的に活用できない、先行のメモリ内アクセラレータの制限を克服すること。
  • 3Dスタックドメモリの論理レイヤーにおける厳密な消費電力および面積予算を尊重しながら、多様なMLアルゴリズムをサポートするシステムを設計すること。
  • 知的な計算分割を通じて、メモリ内アクセラレータと外部コンピューティングプラットフォームを組み合わせることで、メモリ帯域幅をフルに活用すること。

提案手法

  • パターンマッチングを用いて12種類のMLアルゴリズムに共通する計算パターンを同定し、専用で低オーバーヘッドな計算エンジンを導出する。
  • これらの非均質な計算エンジンを3Dスタックドメモリの論理レイヤーに統合し、広範なMLアルゴリズムをサポートする。
  • MLワークロードをメモリ内アクセラレータと外部プラットフォーム(例:FPGA、GPU、TPU)の間で分割する計算分割コンパイラーを開発し、負荷をバランスさせ、プラットフォーム間通信を最小限に抑える。
  • オンチップアクセラレータ(最大47%の帯域幅活用)とオフチッププラットフォームアクセス(内部帯域幅の最大63%)を組み合わせることで、3Dスタックドメモリの内部帯域幅を効率的に活用する。
  • ブロックレベル、パーシャルレベル、モデルレベルの3段階の並列化を適用し、ワークロードの動的分布とリソース利用効率を最適化する。

実験結果

リサーチクエスチョン

  • RQ1限られた消費電力および面積制約の中で、非均質なメモリ内アクセラレータのセットが多様な機械学習アルゴリズムを効率的にサポートできるか。
  • RQ23DスタックドDRAMアーキテクチャにおいて、メモリ内アクセラレータのみで利用可能なメモリ帯域幅をどの程度活用できるか。
  • RQ3メモリ内アクセラレータと外部コンピューティングプラットフォームの間で計算をどのように効果的に分割すれば、帯域幅の活用度を最大化し、通信オーバーヘッドを最小限に抑えられるか。
  • RQ4パターンベースのメモリ内アクセラレーションとオフチップ実行を組み合わせることで、どの程度のパフォーマンスおよびエネルギー効率の向上が達成可能か。

主な発見

  • Origamiは、12種類のMLベンチマークにおいて、最先端の3Dスタックドメモリアクセラレータ比で最大1.6倍のパフォーマンス向上と31倍のエネルギー遅延積(EDP)の改善を達成した。
  • FPGAベースのアクセラレーション比で平均1.5倍の高速化と21倍のEDP改善を達成し、強力なスケーラビリティと効率性を示した。
  • Recoのようなモデルレベル並列性を持つベンチマークでは、ブロックレベル、パーシャルレベル、モデルレベルの3つの並列化タイプをすべて有効にすることで、最大1.6倍の高速化と31倍のEDP低減が達成された。
  • 無制限の計算リソースが論理レイヤーに利用可能である理想のシステムと比較して、結果は1%以内に収まり、帯域幅のほぼ最適な活用が実現していることを示した。
  • パーシャルレベルおよびモデルレベルの並列化を有効にすると、特にBPropやRecoのような複雑なモデルにおいて、ブロックレベルのみの実装に比べて最大26.75%のEDP低減が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。