Skip to main content
QUICK REVIEW

[論文レビュー] Personalized PageRank Estimation and Search: A Bidirectional Approach

Peter Lofgren, Siddhartha Banerjee|arXiv (Cornell University)|Jul 21, 2015
Data Management and Algorithms参考文献 21被引用数 12
ひとこと要約

この論文は、PPRスコアに比例してターゲットをサンプリングすることで、大規模ネットワーク上の効率的なパーソナライズドサーチを可能にする、双方向的パーソナライズドページランク(PPR)推定アルゴリズムを導入する。この手法は、先行する推定器と比較して3倍〜8倍の高速化を達成し、すべての候補をスキャンすることなくトップ-k結果を同定できる最初の手法であり、事前計算された逆方向パスと双方向ランダムウォークを用いて、数十億エッジを持つグラフにおいてサブリニアなクエリ時間を持つ。

ABSTRACT

We present new algorithms for Personalized PageRank estimation and Personalized PageRank search. First, for the problem of estimating Personalized PageRank (PPR) from a source distribution to a target node, we present a new bidirectional estimator with simple yet strong guarantees on correctness and performance, and 3x to 8x speedup over existing estimators in experiments on a diverse set of networks. Moreover, it has a clean algebraic structure which enables it to be used as a primitive for the Personalized PageRank Search problem: Given a network like Facebook, a query like "people named John", and a searching user, return the top nodes in the network ranked by PPR from the perspective of the searching user. Previous solutions either score all nodes or score candidate nodes one at a time, which is prohibitively slow for large candidate sets. We develop a new algorithm based on our bidirectional PPR estimator which identifies the most relevant results by sampling candidates based on their PPR; this is the first solution to PPR search that can find the best results without iterating through the set of all candidate results. Finally, by combining PPR sampling with sequential PPR estimation and Monte Carlo, we develop practical algorithms for PPR search, and we show via experiments that our algorithms are efficient on networks with billions of edges.

研究の動機と目的

  • O(n²)のストレージを要するため、大規模ネットワークにおけるPPRベクトルの事前計算が不可能であるという、パーソナライズドサーチの課題に対処する。
  • すべての候補ターゲットのスコアを計算するためにO(|T|)の時間を要する、従来の手法の非効率性を克服する。
  • すべての候補をイテレートしなくてもトップ-k結果を同定できるスケーラブルなソリューションを開発し、インタラクティブな応答時間を実現する。
  • ソーシャルメディアやユーザ-アイテムグラフなどの実世界のネットワークにおける、PPRベースのサーチの実用的導入を可能にする。
  • 大規模グラフにおけるPPR推定とサーチパフォーマンスの両方について、理論的保証と実験的検証を提供する。

提案手法

  • 前方と逆方向のベクトルの内積としてPPR推定値を計算する双方向PPR推定器を提案し、明確な代数的構造と効率的な計算を可能にする。
  • ターゲットノードからの逆方向ランダムウォークを用いて、事前計算された後退的到達可能性を求める。これにより、任意のソースからのPPR推定が高速に可能になる。
  • PPRスコアに比例して候補ターゲットをサンプリングする2段階アプローチを採用:まず、ソースから前方ウォークをシミュレートし、ターゲットに近づくまで続ける。次に、事前計算済みの逆方向データを用いて、ターゲットを効率的にサンプリングする。
  • 2つの変種を導入:BiPPR-Precomp-Grouped と BiPPR-Precomp-Sampling。両者とも逆方向パスを事前計算し、グループ化することで効率を向上させる。
  • 双方向PPR推定とモンテカルロサンプリング、逐次推定を組み合わせ、実用的なPPRサーチアルゴリズムを構築する。
  • 高いPPRスコアを持つノードはランダムウォークに多くヒットするため、全列挙なしにサンプリングによってトップ結果を効率的に同定可能であるという事実を活用する。

実験結果

リサーチクエスチョン

  • RQ1双方向的PPR推定アプローチは、従来手法と比較して理論的保証と実用的高速化を両立できるか?
  • RQ2PPRベースのパーソナライズドサーチは、候補ターゲット数に対してサブリニア時間で実行可能か?
  • RQ3PPRスコアに基づくサンプリング戦略により、すべての候補を評価せずにトップ-k結果を同定できるか?
  • RQ4双方向PPR推定のパフォーマンスは、数十億エッジを持つ多様な実世界ネットワークにおいてどのようにスケーリングするか?
  • RQ5事前計算された逆方向到達可能性データは、インタラクティブなアプリケーションにおける効率的かつ低遅延のパーソナライズドサーチを可能にするか?

主な発見

  • 双方向PPR推定器は、ウェブやソーシャルグラフを含む多様なネットワークにおいて、FAST-PPRなどの先行推定器と比較して3倍〜8倍の高速化を達成する。
  • Pokecグラフ(3000万エッジ)において、BiPPR-Precomp-Grouped と BiPPR-Precomp-Sampling は、全テスト対象数(|T| = 10 から 10,000)において250ms未満のクエリ時間を達成する。
  • Pokecグラフでは、大規模な|T|に対して双方向アプローチがモンテカルロを上回り、小規模な|T|ではモンテカルロが速いため、性能のトレードオフが相補的であることが示された。
  • Pokecにおける事前計算された逆方向データのストレージは、|T|=10で800KB、|T|=10,000で3MBであり、Twitterグラフ(より大規模)では3MBから30MBにまで拡大するが、低コストのストレージオーバーヘッドであることが示された。
  • このアルゴリズムは数十億エッジのグラフにもスケーリング可能であり、160万ノードと3000万エッジを持つネットワークにおいても効率性が実証された。
  • 本手法により、すべての候補をスキャンしないで実用的なPPRサーチアルゴリズムが実現され、PPRスコアに基づくサンプリングによりサブリニアなクエリ時間が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。