Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Computation of Graph Embeddings

Chi Thang Duong, Hongzhi Yin|arXiv (Cornell University)|Sep 6, 2019
Advanced Graph Neural Networks参考文献 22被引用数 4
ひとこと要約

本論文は、分散クラスタ上で並列グラフ埋め込みをスケーラブルに行うためのフレームワークを提案する。大規模なグラフをアンカーバーテックスを用いて部分グラフに分解し、計算ノード間での埋め込みを整合させる。理論的な誤差バウンダリーを備え、実世界のデータセットにおいて従来手法を上回るスケーラビリティとパフォーマンスを達成する。

ABSTRACT

Graph embedding aims at learning a vector-based representation of vertices that incorporates the structure of the graph. This representation then enables inference of graph properties. Existing graph embedding techniques, however, do not scale well to large graphs. We therefore propose a framework for parallel computation of a graph embedding using a cluster of compute nodes with resource constraints. We show how to distribute any existing embedding technique by first splitting a graph for any given set of constrained compute nodes and then reconciling the embedding spaces derived for these subgraphs. We also propose a new way to evaluate the quality of graph embeddings that is independent of a specific inference task. Based thereon, we give a formal bound on the difference between the embeddings derived by centralised and parallel computation. Experimental results illustrate that our approach for parallel computation scales well, while largely maintaining the embedding quality.

研究の動機と目的

  • 数百億ノードおよび数兆エッジを有する大規模グラフにスケーラブルなグラフ埋め込み技術を適用する課題に対処する。
  • 特に各計算ノードのメモリ制限に起因するリソース制約を克服する。
  • 独立して処理された部分グラフからの埋め込みを統合する手法を開発し、一貫性があり意味のあるグローバル埋め込みを保証する。
  • 下流の推論タスクに依存しない、タスクに依存しない内在的メトリクスを提案し、埋め込み品質を評価する。
  • 中央集権的埋め込みと並列埋め込みの差の理論的バウンダリーを提示し、品質保証を実現する。

提案手法

  • 各ノードのメモリ制限を尊重する制約付きのグラフ分割戦略を用いて、大規模グラフを部分グラフに分解する。
  • 異なる計算ノードから得られる埋め込み空間の整合化を可能にするために、部分グラフに共有されるアンカーバーテックスを導入する。
  • 構造的中心性と接続性が高いため、埋め込み歪みを最小化するように優先順位をつける新しいアンカーピンポイント選択戦略を提案する。
  • 下流タスクに依存せずに埋め込み品質を測定できる、内在的評価手法としてペアワイズ内積(PIP)メトリクスを用いる。
  • 異なる埋め込み空間におけるアンカーベクトルを一致させる線形変換を用いて、部分グラフ埋め込みを統合する。
  • 理論的分析により、PIP距離とアンカーバランスに基づいて、中央集権的埋め込みと並列埋め込みの差の正式なバウンダリーを導出する。

実験結果

リサーチクエスチョン

  • RQ1大規模なグラフを、メモリ制限のある計算ノードのクラスタに効果的に分割し、スケーラブルなグラフ埋め込みを実現するにはどうすればよいか?
  • RQ2別個の部分グラフから得られる埋め込み空間の整合性と意味的整合性を保証するメカニズムは何か?
  • RQ3内在的でタスクに依存しないメトリクスは、分散環境におけるグラフ埋め込みの品質を信頼性を持って評価できるか?
  • RQ4中央集権的計算と並列計算の埋め込み品質の理論的関係は何か?そして、その関係はバウンデッドにできるか?
  • RQ5提案されたフレームワークは、既存の分散グラフ埋め込み手法と比較して、スケーラビリティとパフォーマンスの面でどのように優れているか?

主な発見

  • 提案されたアンカーベースの統合メカニズムは、埋め込み品質を一貫して向上させ、DeepWalkを用いたFlickrデータセットでF1スコアを0.365から0.384に向上させた。
  • 統合済み埋め込み(Recon-S)は、非統合埋め込みよりも中央集権的埋め込みとのPIP距離が低く、忠実度がより高いことを示している。
  • DeepWalkを用いたArxivデータセットにおいて、統合によりリンク予測のAUC(ROC)が0.843から0.878に、APが0.883から0.899に向上した。
  • 本フレームワークは複数の計算ノードにスケーリングされ、数十億ノードを有するグラフにおいても高い埋め込み品質を維持している。
  • PIP距離を用いて、埋め込み差の理論的バウンダリーが導出され、並列化に起因する品質劣化に対する正式な保証が得られた。
  • 共有されないクラスタ環境で動作しながら、DeepWalkやGraphSAGE、SGNのような深層モデルを含む任意の埋め込み手法をサポートする点で、唯一の既存のクラスタベース手法PBGを上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。