Skip to main content
QUICK REVIEW

[論文レビュー] Quiver: Supporting GPUs for Low-Latency, High-Throughput GNN Serving with Workload Awareness

Zeyuan Tan, Xiulong Yuan|arXiv (Cornell University)|May 18, 2023
Advanced Graph Neural Networks被引用数 5
ひとこと要約

Quiver は、予測可能な指標(グラフサンプリングのための確率的サンプルグラフサイズ(PSGS)と配置のための特徴アクセス確率)を用いて、動的にグラフサンプリングと特徴集約をスケジューリングする、ワークロードに適応した GPU アクセelerated GNN サービングシステムであり、最新の DGL や PyG と比較して最大 35× の低遅延および 8× の高スループットを達成している。

ABSTRACT

Systems for serving inference requests on graph neural networks (GNN) must combine low latency with high throughout, but they face irregular computation due to skew in the number of sampled graph nodes and aggregated GNN features. This makes it challenging to exploit GPUs effectively: using GPUs to sample only a few graph nodes yields lower performance than CPU-based sampling; and aggregating many features exhibits high data movement costs between GPUs and CPUs. Therefore, current GNN serving systems use CPUs for graph sampling and feature aggregation, limiting throughput. We describe Quiver, a distributed GPU-based GNN serving system with low-latency and high-throughput. Quiver's key idea is to exploit workload metrics for predicting the irregular computation of GNN requests, and governing the use of GPUs for graph sampling and feature aggregation: (1) for graph sampling, Quiver calculates the probabilistic sampled graph size, a metric that predicts the degree of parallelism in graph sampling. Quiver uses this metric to assign sampling tasks to GPUs only when the performance gains surpass CPU-based sampling; and (2) for feature aggregation, Quiver relies on the feature access probability to decide which features to partition and replicate across a distributed GPU NUMA topology. We show that Quiver achieves up to 35 times lower latency with an 8 times higher throughput compared to state-of-the-art GNN approaches (DGL and PyG).

研究の動機と目的

  • 不規則な計算が発生する GNN サービングの課題に対処すること。具体的には、ノード次数の偏りによって生じるサンプリングおよび集約のワークロードのばらつきを解消すること。
  • GPU のパフォーマンスが予測不能でデータ移動コストが高いため、現在のシステムがサンプリングと集約に CPU を使用しているという制限を克服すること。
  • ワークロードの特性に基づいて GPU の使用を適応的に制御することで、低遅延かつ高スループットを達成する GPU ベースの GNN サービングシステムを設計すること。
  • CPU-GPU 間のデータ移動と通信ボトルネックを最小限に抑えることで、高リクエストレート(例:100K+ リクエスト/秒)の生産環境でも効率的かつスケーラブルな GNN 推論を可能にすること。

提案手法

  • グラフサンプリングタスクの計算負荷を予測し、GPU と CPU のスケジューリングを指揮するランタイム指標として、確率的サンプルグラフサイズ(PSGS)を導入する。
  • PSGS が CPU サンプリングよりもパフォーマンス向上を示す場合にのみ、サンプリングタスクを GPU に動的に割り当てる。これにより、小さなワークロードでは遅延の急増を回避する。
  • 特徴アクセス確率を用いて、分散 GPU NUMA トポロジー上でのデータ配置とレプリケーションを最適化し、GPU 間通信を最小限に抑える。
  • ワンサイドメモリアクセスと GPU バイパスを活用して、特徴収集を高速化し、CPU の関与を減らしてスループットを向上させる。
  • ワークロードに適応したサンプリング、最適化された特徴集約、および DNN 推論を統合したストリーミングパイプラインを実装し、分散 GPU と CPU の間で処理を連携する。
  • CPU ボトルネックを回避するため、高帯域幅・低遅延なデータ移動を実現する NVLink と InfiniBand を活用して、GPU 間およびサーバー間のデータ転送を最適化する。

実験結果

リサーチクエスチョン

  • RQ1不規則なワークロード(偏ったグラフ構造に起因)が生じる GNN サービングにおいて、GPU の使用率をどのように最適化できるか?
  • RQ2GPU ベースのサンプリングが CPU ベースのサンプリングを上回る性能を発揮する状況を予測するためのワークロードに適応した指標として、どのような指標が有効か?
  • RQ3分散 GPU ベースの GNN システムにおいて、特徴の配置およびレプリケーション戦略をどのように最適化すれば通信オーバーヘッドを最小限に抑えられるか?
  • RQ4高スループットな GNN サービングにおいて、GPU アクセelerated 特徴集約は、CPU が調整する通信をどれほど上回れるか?
  • RQ5低レベルの通信最適化(例:NVLink、ワンサイドリード)が、エンドツーエンドの GNN 推論遅延およびスループットに与える影響はどの程度か?

主な発見

  • 同じ 30 ms の遅延ターゲット下で、Quiver は DGL や PyG といった最新のシステムと比較して最大 35× の低遅延および 8× の高スループットを達成している。
  • Reddit データセットでは、2 サーバーで 4.9 ms、8 サーバーで 7.0 ms のサーバー遅延を達成しており、DGL(8.5 ms および 12.2 ms)と AliGraph(6.7 ms および 9.7 ms)を上回っている。
  • Quiver における特徴収集は、NVLink と InfiniBand を使用して最大 40 GB/s のスループットを達成しており、DGL で使用されている RPC ライブラリ(3 GB/s)の 13× にのぼる。
  • InfiniBand を無効化すると mag240m で遅延が 1.6× 増加し、NVLink を無効化すると paper100m で遅延が 1.5× 増加する。これは、高速な相互接続が極めて重要な役割を果たしていることを示している。
  • Quiver のワークロードに適応した特徴配置により、通信オーバーヘッドが低減され、サーバー数を 2 から 8 に増やしても低遅延を維持できる。
  • PSGS を用いた動的スケジューリングにより、GPU 使用は利益がある場合にのみ有効化されるため、小さなリクエストや低複雑度リクエストではパフォーマンスの低下を回避できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。