[论文解读] Locating Contagion Sources in Networks with Partial Timestamps
本论文提出了两种新颖的源定位算法——基于成本的排序(CR)与基于树的排序(TR),用于在仅获得部分感染时间戳的情况下,识别网络中传染过程的起源。通过将问题建模为基于最小成本传播树框架的图排序任务,TR与CR显著优于现有方法,在真实微博数据上实现了高达64%的10%准确率,且TR在各类网络与扩散模型下始终表现更优。
This paper studies the problem of identifying the contagion source when partial timestamps of a contagion process are available. We formulate the source localization problem as a ranking problem on graphs, where infected nodes are ranked according to their likelihood of being the source. Two ranking algorithms, cost-based ranking (CR) and tree-based ranking (TR), are proposed in this paper. Experimental evaluations with synthetic and real-world data show that our algorithms significantly improve the ranking accuracy compared with four existing algorithms.
研究动机与目标
- 解决在仅获得部分感染时间戳时,识别网络中传染源的挑战。
- 提升在完整时间戳数据通常不可用的复杂网络中,源定位的准确性。
- 开发在多种网络拓扑结构与传染扩散模型下均表现良好的鲁棒算法。
- 为现实应用(如社交媒体谣言检测与疾病暴发追踪)提供可扩展且实用的解决方案。
提出的方法
- 将源定位问题建模为图排序任务,根据感染节点作为源的可能性对节点进行排序。
- 提出基于传播树结构与时间戳的二次成本函数 C(P_v),用于评估候选源。
- 设计基于成本的排序(CR),通过在所有以 v 为根的可能传播树中寻找最小成本 C(v),对节点进行排序。
- 提出基于树的排序(TR),通过识别全局最小成本传播树 P*,并根据节点在 P* 上的感染时间对节点进行排序。
- 设计一种贪心的最早感染优先(EIF)算法,为每个候选源近似计算最小成本传播树,从而实现可扩展的计算。
- 通过在应用CR/TR前修改网络图结构,整合如感染方向(例如,谁感染了谁)等辅助信息。
实验结果
研究问题
- RQ1部分时间戳信息是否能显著提升真实网络中传染源定位的准确性?
- RQ2不同网络拓扑结构(如小世界或无标度结构)如何影响源定位算法的性能?
- RQ3是否存在一种排序方法,在多种扩散模型与不完整的时间戳分布下,均优于现有算法?
- RQ4早期到达的感染时间戳相较于后期时间戳,对源定位准确性的贡献有多大?
主要发现
- 在真实微博数据中,TR在仅观察到30%时间戳的情况下,实现了0.64的10%准确率,显著优于NETSLEUTH(0.40)与GAU(0.57)。
- CR与TR在合成网络与真实网络中均优于四种现有算法(GAU、NETSLEUTH、ECCE与RUM),且TR在大多数场景下表现更优。
- 在IAS网络中,当IC模型下时间戳超过50%可用时,CR略优于TR,但TR在多数配置下仍保持优势。
- 所有算法(包括CR与TR)在直径较小且存在中心节点的网络(如IAS)中性能显著低于局部树状网络(如PG),表明拓扑结构带来的挑战。
- 早期时间戳比近期时间戳更具信息量,早期感染数据的价值对准确的源定位至关重要。
- 即使仅观察到30%的感染节点,所提算法仍保持有效性,表明其对感染集合部分观测具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。