Skip to main content
QUICK REVIEW

[論文レビュー] Tracking Top-K Influential Vertices in Dynamic Networks

Yang Yu, Zhefeng Wang|arXiv (Cornell University)|Mar 5, 2018
Data Stream Mining Techniques参考文献 10被引用数 3
ひとこと要約

本稿では、線形閾値(LT)および独立カスケード(IC)モデルにおける動的ネットワークにおける上位k位の影響力を持つ頂点を追跡するスケーラブルで証明可能な正確性を持つ手法を提案する。ランダムなRR集合のサンプルを維持し、2つのO(1)時間信号を用いてRR集合の数を動的に調整することで、乗法的誤差の保証を達成し、先行研究と比較して影響力最大化クエリにおいて最大10倍の高速化を実現する。

ABSTRACT

Influence propagation in networks has enjoyed fruitful applications and has been extensively studied in literature. However, only very limited preliminary studies tackled the challenges in handling highly dynamic changes in real networks. In this paper, we tackle the problem of tracking top-$k$ influential vertices in dynamic networks, where the dynamic changes are modeled as a stream of edge weight updates. Under the popularly adopted linear threshold (LT) model and the independent cascade (IC) model, we address two essential versions of the problem: tracking the top-$k$ influential individuals and finding the best $k$-seed set to maximize the influence spread (Influence Maximization). We adopt the polling-based method and maintain a sample of random RR sets so that we can approximate the influence of vertices with provable quality guarantees. It is known that updating RR sets over dynamic changes of a network can be easily done by a reservoir sampling method, so the key challenge is to efficiently decide how many RR sets are needed to achieve good quality guarantees. We use two simple signals, which both can be accessed in $O(1)$ time, to decide a proper number of RR sets. We prove the effectiveness of our methods. For both tasks the error incurred in our method is only a multiplicative factor to the ground truth. For influence maximization, we also propose an efficient query algorithm for finding the $k$ seeds, which is one order of magnitude faster than the state-of-the-art query algorithm in practice. In addition to the thorough theoretical results, our experimental results on large real networks clearly demonstrate the effectiveness and efficiency of our algorithms.

研究の動機と目的

  • リアルタイムでのエッジ重みの更新が続く大規模で高動的なネットワークにおいて、上位k位の影響力を持つ頂点を追跡する課題に対処すること。
  • LTおよびICモデル下での影響力推定とシード集合選択に対して、証明可能な品質保証を提供すること。
  • 絶対誤差閾値ではなく相対誤差閾値を用いることで、ネットワーク特性に関する事前知識の必要性を排除すること。
  • 最小限のRR集合数を維持しながら高い正確性を保証する効率的でスケーラブルなアルゴリズムを設計すること。
  • サンプルされたRR集合上でグリーディーなシード選択プロセスを最適化することで、影響力最大化クエリの高速化を図ること。

提案手法

  • 証明可能な正確性で頂点の影響力を近似するため、ランダムな逆到達可能(RR)集合に基づくポーリング手法を用いる。
  • 動的エッジ重みの変更に応じてRR集合を効率的に更新するために、リザボア・サンプリングを採用する。
  • 所望の誤差境界を達成するために必要なRR集合の最適数を決定する2つのO(1)時間信号を導入する。
  • 影響力拡散関数の逆関数を用いた理論的境界を適用することで、乗法的誤差の保証を確立する。
  • 冗長な計算を削減することで、影響力最大化を高速化する新規グリーディークエリアルゴリズム(New Greedy)を提案する。
  • 理論的境界に基づく実用的ヒューリスティックなサンプルサイズを用いることで、実際の応用において正確性と効率性のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1継続的なエッジ更新が行われる動的ネットワークにおいて、上位k位の影響力を持つ頂点の影響力推定をどのように正確に維持できるか。
  • RQ2所望の相対誤差を達成するために必要なRR集合の数を効率的かつ軽量に特定する方法は何か。
  • RQ3解決策の品質を維持しつつ、既存の手法と比較して著しく高速な影響力最大化クエリアルゴリズムを設計できるか。
  • RQ4提案手法は、LTおよびIC影響拡散モデル下で、大規模で実世界の動的ネットワークにおいてどのようにスケーリングするか。
  • RQ5正確性を損なわずに、RR集合の数をどの程度まで削減できるか。

主な発見

  • 本手法は、ネットワークに関する事前知識がなくても、影響力推定の相対誤差が真の影響力の乗法的要因で制限されることを保証する。
  • Ohsakaらの最先端手法[20]と比較して、最大10倍少ないRR集合数を維持しており、メモリ効率が著しく向上している。
  • New Greedyクエリアルゴリズムは、[20]におけるLazy Evaluation手法と比較して最大10倍の高速化を達成し、Twitterネットワークでは300ms未満で結果を得られた。
  • 最大のデータセット(Twitter)において、0.3百亿件の更新を4時間未満で処理した。これは強力なスケーラビリティを示している。
  • 理論的境界に基づく実用的サンプルサイズヒューリスティックは、実際の応用でも効果的に機能し、最小限のRR集合数で高い正確性を維持した。
  • 実世界のネットワークにおいて、影響力推定の相対誤差率が2%未満に抑えられ、実験的評価で確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。