Skip to main content
QUICK REVIEW

[論文レビュー] Combining Emulation and Simulation to Evaluate a Near Memory Key/Value Lookup Accelerator

Joshua Landgraf, Scott Lloyd|arXiv (Cornell University)|May 13, 2021
Radiation Effects in Electronics参考文献 11被引用数 8
ひとこと要約

本論文は、ハイブリッドメモリキューブ(HMC)アーキテクチャ向けに、ハードウェアエミュレーションとソフトウェアシミュレーションを組み合わせたハイブリッド評価フレームワークを提案する。HMC-SimメモリモデルとSSTベースのアクセラレータシミュレーションを統合することで、128Bキーパケット化、広帯域のインターフェース、並列リクエストの増加といった最適化を同定し、単一アクセラレータの性能を93–136%向上させるとともに、複数アクセラレータを用いたスケーリングで2.7–5.7倍のスループット向上を達成し、元の設計比で最大13倍の高速化を実現した。

ABSTRACT

Processing large numbers of key/value lookups is an integral part of modern server databases and other "Big Data" applications. Prior work has shown that hash table based key/value lookups can benefit significantly from using a dedicated hardware lookup accelerator placed near memory. However, previous evaluations of this design on the Logic in Memory Emulator (LiME) were limited by the capabilities of the hardware on which it was emulated, which only supports a single CPU core and a single near-memory lookup engine. We extend the emulation results by incorporating simulation to evaluate this design in additional scenarios. By incorporating an HMC simulation model, we design optimizations that better mitigate the effects of the HMC closed page policy and that better utilize the HMC's parallelism, improving predicted performance by an order of magnitude. Additionally, we use simulation to evaluate the scaling performance of multiple near-memory lookup accelerators. Our work employs an open source emulator LiME, open source simulatation infrastructure SST, and the open source HMC-Sim simulator.

研究の動機と目的

  • ハードウェアエミュレーションのみに依存する限界を超えて、ニアメモリキー/バリュー検索アクセラレータの性能を評価すること。
  • クローズドページポリシーと制限された並列性といった現実的なHMCメモリ制約下で性能を向上させるアーキテクチャ的最適化を同定すること。
  • シミュレートされたHMC環境における複数アクセラレータのスケーリング挙動を評価すること。
  • LiME, SST, HMC-Simといったオープンソースツールを活用して、メモリ最適化アクセラレータの正確で再現可能かつ拡張可能な評価を実現すること。

提案手法

  • 本研究では、ナノ秒単位の時間分解能を持つLiMEハードウェアエミュレータを用いて、1つのニアメモリ検索アクセラレータをモデル化する。
  • SSTフレームワークを用いたソフトウェアシミュレーションにより、アクセラレータとHMC-Simメモリモデルを統合し、バンク競合やメモリ遅延といったHMC固有の挙動を正確にモデル化できるようにする。
  • キーバリューストアはオープンアドレス方式のハッシュテーブルとして実装され、検索エンジンはハッシュ化されたインデックスから始まるプローブシーケンスを処理する。
  • 最適化には、キーデータを128Bのパケットにバッチ処理する、インターフェースバス幅を2倍にする、同時に処理可能なメモリリクエスト数の上限を増加させるといったものがある。
  • 性能評価は、均一分布およびZipf分布のクエリパターンの両方を想定し、異なる負荷係数とメモリモデルの下で結果を比較する。
  • スケーリング評価は1~8個のアクセラレータを用いて実施され、実際のHMC-Simと理想化された高帯域幅エミュレータメモリモデルの両方を用いて、帯域幅と並列性のボトルネックを分離して評価する。

実験結果

リサーチクエスチョン

  • RQ1簡素化されたメモリモデルと比較して、現実的なHMCメモリ制約下におけるニアメモリキー/バリュー検索アクセラレータの性能劣化はどの程度か?
  • RQ2バンク競合や制限されたメモリ並列性といったHMC固有のボトルネックを軽減するためのアーキテクチャ的最適化は何か?
  • RQ3HMC上に複数のアクセラレータを並列に配置した場合、アクセラレータの性能はどのようにスケーリングするか?
  • RQ4アクセラレータ性能の主なボトルネックは、メモリ帯域幅か、メモリ並列性のどちらであるか?

主な発見

  • 128Bキーパケット化と広帯域インターフェースの組み合わせにより、バンク競合の低減とメモリスループットの向上が実現し、単一アクセラレータの性能が最大136%向上した。
  • 同時に処理可能なメモリリクエスト数を増加させることで、性能が最大33%向上した。これはリクエストレベルの並列性が重要なボトルネックではあるが、支配的ではないことを示している。
  • 2つのアクセラレータを用いた場合、スループットは63–100%向上した。4つの場合にさらに54–92%の向上が得られ、8つのアクセラレータでは合計で2.7–5.7倍の性能向上を達成した。
  • スケーリング性能は、CPUのオーバーヘッドが顕著でない高負荷係数で最も顕著であり、この状況ではメモリ並列性が性能の主要因となる。
  • 128 GB/sの帯域幅を持つ理想化されたメモリモデルでは、単一アクセラレータの性能がHMC-Sim結果と5%以内で一致し、シミュレーションの正確性を裏付けた。
  • 結果から、現実的なHMC環境下では、帯域幅ではなくメモリ並列性がマルチアクセラレータ展開における主なボトルネックであると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。