Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Infection Sources Identification with Provable Guarantees

Hung T. Nguyen, Preetam Ghosh|arXiv (Cornell University)|Aug 23, 2016
Complex Network Analysis Techniques参考文献 14被引用数 4
ひとこと要約

本稿では、感染源の数を事前に知らない一般のグラフにおいて、複数の感染源を特定するための、保証付きの近似アルゴリズムであるSISIを提案する。Truncated Reverse Infection Sampling(TRIS)と原双対法を用いて、観測された感染ノードとカスケードシミュレーションの対称差を最小化し、高確率で $\frac{2}{(1-\epsilon)^2}\Delta$-近似を達成する。F1スコアと対称差の両面で最先端の手法を上回っている。

ABSTRACT

Given an aftermath of a cascade in the network, i.e. a set $V_I$ of "infected" nodes after an epidemic outbreak or a propagation of rumors/worms/viruses, how can we infer the sources of the cascade? Answering this challenging question is critical for computer forensic, vulnerability analysis, and risk management. Despite recent interest towards this problem, most of existing works focus only on single source detection or simple network topologies, e.g. trees or grids. In this paper, we propose a new approach to identify infection sources by searching for a seed set $S$ that minimizes the \emph{symmetric difference} between the cascade from $S$ and $V_I$, the given set of infected nodes. Our major result is an approximation algorithm, called SISI, to identify infection sources \emph{without the prior knowledge on the number of source nodes}. SISI, to our best knowledge, is the first algorithm with \emph{provable guarantee} for the problem in general graphs. It returns a $\frac{2}{(1-ε)^2}Δ$-approximate solution with high probability, where $Δ$ denotes the maximum number of nodes in $V_I$ that may infect a single node in the network. Our experiments on real-world networks show the superiority of our approach and SISI in detecting true source(s), boosting the F1-measure from few percents, for the state-of-the-art NETSLEUTH, to approximately 50\%.

研究の動機と目的

  • 一般のグラフにおける複数の感染源を特定する課題に取り組むこと。既存の手法は単一の感染源や単純なトポロジーを仮定している。
  • 感染源の数に関する事前知識を必要としない手法を開発すること。
  • 観測された感染ノード集合と候補感染源からのカスケードとの間の対称差を最小化すること。
  • 一般のグラフにおける複数感染源検出問題に対して、保証付きの精度を持つ近似アルゴリズムを提供すること。

提案手法

  • 感染源検出を、観測された感染ノード集合 $V_I$ とシード集合 $S$ からのカスケードとの間の対称差を最小化する問題として定式化する。
  • 感染の広がりの様子を符号化する効率的なランダム到達集合を生成するために、Truncated Reverse Infection Sampling(TRIS)を導入する。
  • 対称差の目的関数の下で最適化問題を解くために、部分集合コスト被覆問題に対する原双対アルゴリズムを適用する。
  • 感染プロセスの確率的性質に対処し、計算複雑性を低減するために、サンプリングに基づくアプローチを採用する。
  • 高確率で $\frac{2}{(1-\epsilon)^2}\Delta$-近似解を返す確率的アルゴリズムを用いる。
  • 独立カスケード(IC)モデルや不完全な観測に対しても動作するようにフレームワークを拡張し、サンプリング手順にわずかな修正を加える。

実験結果

リサーチクエスチョン

  • RQ1事前に感染源の数を知らない状態で、一般のグラフにおける複数の感染源を特定することは可能か?
  • RQ2任意のネットワークトポロジーにおいて、保証付きの性能を持つ近似アルゴリズムを設計することは可能か?
  • RQ3観測されたカスケードとシミュレートされたカスケードの対称差を最小化することは、MDL や次数基準と比較して、感染源検出の正確性をどのように向上させるか?
  • RQ4確率的プロセスの性質を考慮しながら、最適な感染源集合を効果的に近似できるか?
  • RQ5SISIの性能は、NETSLEUTH や k-effector といった最先端手法と比較して、感染源の数や感染サイズが変化する条件下でどのように変化するか?

主な発見

  • SISIは、実世界のネットワークにおいて真の感染源を検出するF1スコアを約50%に達成し、NETSLEUTHの0%と比べて顕著な向上を示した。
  • 独立カスケードモデル下で、SISIはk-effector法と比較して対称差を50%以上削減し、1つの感染源の場合にそれぞれ6.6 vs. 18.4の値を示した。
  • $|V_I| = 1000$ の実験では、SISIは真の感染源の70%以上を検出できたが、NETSLEUTH や Max-Degree は0%であった。
  • より高速な変種であるSISI-relaxも強力な性能を維持し、真の感染源の50%以上を検出でき、SISIと同程度の対称差値を達成した。
  • SISIはNETSLEUTHより遅いが、はるかに優れた正確性を示し、保証付きの近似性能のおかげでその妥当性が裏付けられている。
  • SISIは、さまざまなネットワークタイプや感染サイズに対して一貫して頑健であり、グリーディ法 や Max-Degree といったヒューリスティック手法を常に上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。