Skip to main content
QUICK REVIEW

[論文レビュー] Accelerating bandwidth-bound deep learning inference with main-memory accelerators

Benjamin Y. Cho, Jeageun Jung|arXiv (Cornell University)|Nov 14, 2021
Parallel Computing and Optimization Techniques被引用数 21
ひとこと要約

本稿では、処理内メモリ(PIM)ユニットを用いてCPUメインメモリ上でGEMM演算を直接実行することにより、帯域幅制限の深刻なディープラーニング推論ワークロードを高速化するメインメモリアクセラレータアーキテクチャ「StepStone」を提案する。GEMMのデータ局所性を活用し、カスタムアドレス生成論理を設計することで、高速CPUよりも最大16倍の高速化、かつ従来のメインメモリアクセラレーション手法よりも2.4倍の高速化を達成し、大規模で縦長/スリムな行列においてCPUよりも12倍低い最小遅延を実現した。

ABSTRACT

Matrix-matrix multiplication operations (GEMMs) are important in many HPC and machine-learning applications. They are often mapped to discrete accelerators (e.g., GPUs) to improve performance. However, we find that large tall/skinny and fat/short matrices benefit little from discrete acceleration and also do not perform well on a CPU. Such matrices are prevalent in important workloads, such as deep-learning inference within large-scale datacenters. We demonstrate the large potential of accelerating these GEMMs with processing in the main CPU memory, where processing in memory units (PIMs) take advantage of otherwise untapped bandwidth without requiring data copies. We develop a novel GEMM execution flow and corresponding memory-side address-generation logic that exploits GEMM locality and enables long-running PIM kernels despite the complex address-mapping functions employed by the CPU. Our evaluation of StepStone variants at the channel, device, and within-device PIM levels demonstrate 12X better minimum latency than a CPU and 2.8X greater throughput for strict query latency constraints. End-to-end performance analysis of recent recommendation and language models shows that StepStone outperforms a fast CPU by up to 16X and also the best prior main-memory acceleration approaches by up to 2.4X.

研究の動機と目的

  • CPUおよびディスcreteアクセラレータの両方において、大規模で縦長/スリムな、および太め/短いGEMM演算の性能が著しく低い問題に対処すること。
  • 従来の加速手法で十分にサポートされない帯域幅制限の深刻なGEMMワークロードを、処理内メモリ(PIM)がどのように高速化できるかを検討すること。
  • 複雑なCPUアドレスマッピングに耐えうる長時間実行可能なPIMカーネルを可能にする、新しいGEMM実行フローとメモリサイドのアドレス生成論理の設計。
  • PIMの統合レベル(チャネル、デバイス、デバイス内)の複数の段階でStepStoneを評価し、実世界のモデルにおいてエンドツーエンドの性能向上を示すこと。

提案手法

  • ディープラーニング推論で一般的な大規模で縦長/スリムな、および太め/短い行列におけるデータ局所性を活用した、新しいGEMM実行フローの設計。
  • 現代のCPUが使用する複雑なアドレスマッピング関数に対応しつつ、長時間実行可能なPIMカーネルを可能にする、カスタムメモリサイドのアドレス生成論理の開発。
  • データ移動を排除し、未利用のメモリ帯域幅を活用するために、PIMユニットをメインメモリサブシステムに直接統合。
  • 統合の粒度の異なる3段階(チャネルレベル、デバイスレベル、デバイス内レベル)でのPIM統合を評価。
  • 厳密なクエリ遅延制約のもとでPIMカーネル実行を最適化し、遅延を最小限に抑え、スループットを最大化。
  • 実世界の推薦および言語モデルにおけるエンドツーエンドの性能分析を実施し、システムレベルの利点を検証。

実験結果

リサーチクエスチョン

  • RQ1処理内メモリ(PIM)アーキテクチャは、ディープラーニング推論ワークロードにおける帯域幅制限の深刻なGEMM演算を効果的に高速化できるか?
  • RQ2現代のCPUが使用する複雑なアドレスマッピング関数がある中で、PIMカーネルを長時間実行可能にするにはどうすればよいか?
  • RQ3CPUおよびディスcreteアクセラレータと比較して、メインメモリサブシステムにPIMユニットを統合することで、どの程度の性能向上が達成できるか?
  • RQ4StepStoneの設計は、PIM統合のレベル(チャネル、デバイス、デバイス内)において、どのようにスケーラブルか?
  • RQ5実世界の推薦および言語モデルは、メインメモリ上でのGEMM高速化によって、どの程度の恩恵を受けるか?

主な発見

  • 帯域幅制限の深刻なGEMM演算において、StepStoneはCPUよりも12倍低い最小遅延を達成し、顕著な遅延低減を実証した。
  • 厳密なクエリ遅延制約のもとで、StepStoneはCPUよりも2.8倍高いスループットを達成し、効率の向上を示した。
  • エンドツーエンドの評価により、StepStoneは実世界の推薦および言語モデルにおいて、高速CPUよりも最大16倍の性能向上を達成した。
  • 最良の従来のメインメモリアクセラレーション手法と比較して、StepStoneは最大2.4倍の性能向上を達成した。
  • 提案されたアドレス生成論理は、複雑なCPUアドレスマッピングに対しても長時間実行可能なPIMカーネルを実現し、不規則なワークロードにおけるPIMの潜在能力を解放した。
  • チャネル、デバイス、デバイス内レベルのPIM統合における評価を通じて、一貫した性能向上が確認され、設計のスケーラビリティが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。