Skip to main content
QUICK REVIEW

[論文レビュー] RecSSD: Near Data Processing for Solid State Drive Based Recommendation Inference

Mark Wilkening, Udit Gupta|arXiv (Cornell University)|Jan 29, 2021
Advanced Data Storage Technologies参考文献 30被引用数 4
ひとこと要約

RecSSDは、推薦推論における主要なボトル neck である埋め込みテーブル操作を直接 SSD にオフロードする近接データ処理(NDP)アーキテクチャを提案する。従来の SSD と比較してエンドツーエンドの推論遅延を最大 2 倍まで短縮する。SSD 自体で gather および集計計算を実行し、ホストおよびデバイス側のキャッシュを活用することで、実際の OpenSSD プラットフォーム上での埋め込み操作遅延を最大 4 倍まで低減した。

ABSTRACT

Neural personalized recommendation models are used across a wide variety of datacenter applications including search, social media, and entertainment. State-of-the-art models comprise large embedding tables that have billions of parameters requiring large memory capacities. Unfortunately, large and fast DRAM-based memories levy high infrastructure costs. Conventional SSD-based storage solutions offer an order of magnitude larger capacity, but have worse read latency and bandwidth, degrading inference performance. RecSSD is a near data processing based SSD memory system customized for neural recommendation inference that reduces end-to-end model inference latency by 2X compared to using COTS SSDs across eight industry-representative models.

研究の動機と目的

  • データセンタの推薦システムにおける大容量 DRAM ベースの埋め込みテーブルの高コストとパフォーマンスボトル neck を解決すること。
  • 大容量かつ低遅延な推薦推論に使用される従来の SSD の遅延および帯域幅制限を克服すること。
  • 知的なデバイス内処理を活用することで、コスト効率が良くスケーラブルな大規模推薦モデルの展開を可能にすること。
  • オープンソースハードウェアと標準 NVMe インターフェースを用いて、生産環境向けデータセンター環境における NDP の実用的妥当性を実証すること。

提案手法

  • 近接データ処理(NDP)機能を活用して、CPU から SSD に埋め込みテーブル操作(gather および集計)を完全にオフロードする。
  • ホストのハードウェアやプロトコルを変更せずに、SSD の FTL(フラッシュ翻訳層)にカスタムファームウェアを統合して NDP タスクを実行する。
  • ホスト側の DRAM キャッシュと SSD 側のキャッシュを組み合わせたハイブリッドキャッシュ戦略を採用し、クエリの局所性パターンを活用する。
  • ホストに NDP インターフェースを公開するため、修正済みの UNVMe ドライバーライブラリを活用し、既存の推薦ワークロードとのシームレスな統合を実現する。
  • Facebook の DLRM から得た実世界のトレースデータと合成ワークロードを用いて、生産規模のアクセスパターンをモデル化する。
  • Xilinx SDK と NVMe 互換ファームウェアを用いて、実際の Cosmos+OpenSSD プラットフォーム上にシステムを実装し、生産環境での実用性を確保する。
Figure 1. Recommendation models process both categorical and continuous input features.
Figure 1. Recommendation models process both categorical and continuous input features.

実験結果

リサーチクエスチョン

  • RQ1従来の SSD と比較して、SSD における近接データ処理が神経推薦モデルのエンドツーエンド推論遅延を顕著に短縮できるか?
  • RQ2デバイス内での埋め込み操作の計算が、DRAM と SSD の間のパフォーマンスギャップを是正するのにどの程度有効か?
  • RQ3ホスト側および SSD 側のキャッシュは、推薦推論ワークロードの遅延低減において、どの程度相乗効果を発揮するか?
  • RQ4ハードウェアの変更なしに、完全にソフトウェア実装された NDP ソリューションをコンsumer SSD に展開できるか?
  • RQ5RecSSD のパフォーマンスは、多様で業界代表的な推薦モデルにおいてどのように影響を受けるか?

主な発見

  • RecSSD は、8 つの業界代表的な推薦モデルにおいて、ベースラインの COTS SSD と比較してエンドツーエンド推論遅延を最大 2 倍まで短縮した。
  • 埋め込み操作が支配的であるメモリバウンドモデルでは、個々の埋め込みテーブル操作における遅延を最大 4 倍まで低減した。
  • 8 つのモデルのうち 5 つについては、計算が主な要因でメモリバウンドではないモデルにおいて、DRAM ベースのシステムと同等のパフォーマンスを示した。
  • RecSSD のハイブリッドキャッシュ戦略は、実際の推薦ワークロードで観察されるアクセスの局所性パターンを効果的に活用することで、全体の遅延を低減した。
  • 標準 NVMe インターフェースを用いた実際の OpenSSD プラットフォーム上での実装により、データセンター環境における NDP の実装可能性と実用性が確認された。
  • 本研究は、ハードウェアの変更を一切行わず、FTL および UNVMe スタック内のファームウェアおよびドライバーモディフィケーションに依存して、これらの利点を達成した。
Figure 2. In order to support a high performance and simple logical block interface to the host while handling the peculiarities of NAND Flash memories, SSDs are designed with a Microprocessor operating alongside dedicated memory controllers.
Figure 2. In order to support a high performance and simple logical block interface to the host while handling the peculiarities of NAND Flash memories, SSDs are designed with a Microprocessor operating alongside dedicated memory controllers.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。