Skip to main content
QUICK REVIEW

[論文レビュー] Graph Embeddings at Scale

C. Bayan Bruss, Anish Khazane|arXiv (Cornell University)|Jul 3, 2019
Advanced Graph Neural Networks参考文献 17被引用数 4
ひとこと要約

本論文では、グラフ分割を伴わずにスケールするグラフ埋め込みの分散型、パラメータサーバー基盤のシステムを提案する。エンティティベースのパラメータサーバーと動的でサイズ制限付きの計算グラフを用いることで、GPU/CPUの効率的利用が可能となり、5000万頂点の非均質的グラフにおいて90%の高いリンク予測精度を達成するとともに、Friendster(6800万頂点)においても高速な収束を示した。ワークリソースを増やすことで性能が向上する。

ABSTRACT

Graph embedding is a popular algorithmic approach for creating vector representations for individual vertices in networks. Training these algorithms at scale is important for creating embeddings that can be used for classification, ranking, recommendation and other common applications in industry. While industrial systems exist for training graph embeddings on large datasets, many of these distributed architectures are forced to partition copious amounts of data and model logic across many worker nodes. In this paper, we propose a distributed infrastructure that completely avoids graph partitioning, dynamically creates size constrained computational graphs across worker nodes, and uses highly efficient indexing operations for updating embeddings that allow the system to function at scale. We show that our system can scale an existing embeddings algorithm - skip-gram - to train on the open-source Friendster network (68 million vertices) and on an internal heterogeneous graph (50 million vertices). We measure the performance of our system on two key quantitative metrics: link-prediction accuracy and rate of convergence. We conclude this work by analyzing how a greater number of worker nodes actually improves our system's performance on the aforementioned metrics and discuss our next steps for rigorously evaluating the embedding vectors produced by our system.

研究の動機と目的

  • 数百万の頂点を持つ巨大グラフにスケーラブルにグラフ埋め込みの学習を適用する課題に対処すること。
  • 分散学習システムにおける高コストなグラフ分割の必要性を排除すること。
  • エンティティベースのパラメータサーバーを用いて、ワーカーノード間での効率的で動的な計算を可能にすること。
  • 非同期的で分散型の学習により、収束速度とリンク予測精度を向上させること。
  • ワーカーノード数の増加が学習パフォーマンスと埋め込み品質に与える影響を評価すること。

提案手法

  • 入力グラフを固定サイズのランダムウォーク行列に変換することで、グラフ分割を伴わずにワーカーノード間で行方向に分割可能となる。
  • 各ワーカーノードは、各学習イテレーションごとに動的かつ制限付きのTensorFlow計算グラフを生成し、GPUメモリ使用量を制限する。
  • エンティティベースのパラメータサーバーが埋め込みを格納・提供し、効率的なインデキシングによりワーカーが必要な頂点埋め込みのみを取得可能となる。
  • ノイズ対比推定(NCE)損失を用いた非同期的な埋め込み更新により、非均質的グラフにおけるスケーラブルな学習が可能となる。
  • GPUに負荷のかかる学習とCPU/RAMベースのパラメータ保存を分離することで、リソース利用効率を最適化する。
  • 任意の数のワーカーノードをサポートし、すべてのノードに勾配更新を分散させることで、効率的なスケーリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1グラフ分割を伴わずに、どのように効率的にグラフ埋め込みの学習をスケーリングできるか?
  • RQ2ワーカーノード数を増加させた場合、収束速度とリンク予測精度にどのような影響を与えるか?
  • RQ3大規模で非均質的グラフ上で学習を実行しても、高品質な埋め込みを維持できるか?
  • RQ4動的計算グラフの作成は、学習効率とGPU利用効率をどのように向上させるか?
  • RQ5非同期的かつエンティティベースのパラメータサーバー通信は、スケーラビリティとパフォーマンスをどの程度向上させるか?

主な発見

  • 本システムは、5000万頂点・2億8000万エッジの内部非均質的グラフにおいて、90%のリンク予測精度を達成した。
  • Friendsterデータセット(6800万頂点)において、本システムは高速な収束と高いリンク予測精度を示し、ワーカー数を増やすことで性能が向上した。
  • ワーカー数を増やすことで、特にステップ300以降にかけて収束が速くなり、最終的な精度も向上した。これは、より豊富なトポロジカル信号の統合によるものである。
  • ワーカー数の増加に伴っても、性能の劣化を伴わず、高品質な埋め込みを維持した。
  • 動的計算グラフと効率的なインデキシングの活用により、GPUの有効な利用が可能となり、メモリオーバーヘッドを最小限に抑えた。
  • エンティティベースのパラメータサーバーを用いた非同期学習により、グローバルに正則化された更新が可能となり、埋め込みの一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。