Skip to main content
QUICK REVIEW

[論文レビュー] Efficient SimRank Computation via Linearization

Takanori Maehara, Mitsuru Kusumoto|arXiv (Cornell University)|Nov 26, 2014
Web Data Mining and Analysis参考文献 40被引用数 16
ひとこと要約

本稿では、効率的なSimRank計算のための新しい線形化技術を提案する。再帰的SimRank問題を反復法で解ける線形系に変換することで、単一ペア、単一ソース、すべてのペアSimRank計算を高速化する。ガウス=サザンウェル緩和と確率的しきい値処理を活用することで、web-Google や soc-Epinions1 などの大規模グラフにおいて、実行時間を最大10倍短縮し、メモリ使用量を最大50%削減する。

ABSTRACT

SimRank, proposed by Jeh and Widom, provides a good similarity measure that has been successfully used in numerous applications. While there are many algorithms proposed for computing SimRank, their computational costs are very high. In this paper, we propose a new computational technique, "SimRank linearization," for computing SimRank, which converts the SimRank problem to a linear equation problem. By using this technique, we can solve many SimRank problems, such as single-pair compuation, single-source computation, all-pairs computation, top k searching, and similarity join problems, efficiently.

研究の動機と目的

  • 大規模グラフにおける伝統的SimRank計算の高コスト問題に対処する。
  • 単一ペア、単一ソース、すべてのペア、top-k、類似度ジョインを含む、さまざまなクエリタイプのSimRankを効率的に計算可能にする。
  • 数十億のエッジを有する実世界のグラフに適したスケーラブルで正確なアルゴリズムを開発する。
  • 確率的しきい値処理や適応的モンテカルロサンプリングを含む、新たな最適化技術によって、メモリ消費量と実行時間を削減する。

提案手法

  • SimRankの行列表現を活用して、再帰的SimRank定式化を線形系に変換する。
  • ガウス=サザンウェル緩和を適用し、計算オーバーヘッドを低減しながら線形系を反復的に解く。
  • 低影響更新を動的にプルーニングするため、確率的しきい値処理を導入し、正確性を損なわずメモリ使用量を削減する。
  • 検証フェーズで適応的モンテカルロサンプリングを用いることで、候補ペアに対する不要な計算を最小限に抑える。
  • SimRankの二乗グラフ解釈を活用し、ラベル伝搬またはランダムウォークプロセスとしてモデル化する。
  • 数学的解析とアルゴリズム最適化を統合し、パrameterチューニング下で収束性と正確性を保証する。

実験結果

リサーチクエスチョン

  • RQ1SimRank計算を線形系に再定式化することで、より高速かつスケーラブルな解決策が可能になるか?
  • RQ2ガウス=サザンウェル緩和と確率的しきい値処理は、大規模グラフにおける時間的・メモリ的コスト削減にどの程度効果的か?
  • RQ3適応的モンテカルロサンプリングは、SimRankスコアの検証においてどの程度効率性を向上させるか?
  • RQ4実世界のネットワークにおいて、SimRank > 0.001 を満たす類似ペアの数は、以前に提唱された通りのべき乗則分布に従うか?
  • RQ5大規模データセット上での既存のSimRankアルゴリズムと比較して、提案手法の性能と正確性はどの程度か?

主な発見

  • 提案手法は、web-Google や soc-Epinions1 などの大規模グラフにおいて、従来手法と比較して実行時を最大10倍短縮し、メモリ使用量を最大50%削減した。
  • ガウス=サザンウェル緩和で γ ≥ 0.9 を使用すると正確性が向上するが、計算時間は5倍、メモリ使用量は10倍に増加するため、スケーラブルな展開には γ = 0 で十分であると示唆された。
  • 確率的しきい値処理により、特定のグラフではメモリ使用量を最大50%削減でき、β = 100 は β = ∞ とほぼ同等の結果を達成した。
  • 適応的モンテカルロサンプリングにより、平均計算コストが約1/3削減された。これは、約1/3の候補ペアが1,000回以上のサンプルを必要としていることによる。
  • SimRank > 0.001 を満たす類似ペアの数は、全テストデータセットでべき乗則分布に従うことが確認され、Caiらの仮説がより大きなネットワークでも成立することが裏付けられた。
  • 本手法は、1,100万頂点、数億エッジを有する web-Google(11M頂点、151GBメモリ)や cit-patent(209K頂点、3.6GB)などの、1,000万以上の頂点と数億エッジを有するグラフに対しても、効果的にスケーリング可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。