[论文解读] Back to the Past: Source Identification in Diffusion Networks from Partially Observed Cascades
本文提出了一种两阶段框架,用于从部分观测到的级联传播中识别信息在网络中的传播源和启动时间。通过将传播建模为连续时间过程,并使用重要性采样进行似然最大化,该方法在源识别和时间精度方面显著优于先前的方法,在真实世界中的网络病毒式传播数据中实现了低于45天的误差。
When a piece of malicious information becomes rampant in an information diffusion network, can we identify the source node that originally introduced the piece into the network and infer the time when it initiated this? Being able to do so is critical for curtailing the spread of malicious information, and reducing the potential losses incurred. This is a very challenging problem since typically only incomplete traces are observed and we need to unroll the incomplete traces into the past in order to pinpoint the source. In this paper, we tackle this problem by developing a two-stage framework, which first learns a continuous-time diffusion network model based on historical diffusion traces and then identifies the source of an incomplete diffusion trace by maximizing the likelihood of the trace under the learned model. Experiments on both large synthetic and real-world data show that our framework can effectively go back to the past, and pinpoint the source node and its initiation time significantly more accurately than previous state-of-the-arts.
研究动机与目标
- 解决在仅观测到部分感染时间的情况下,识别扩散级联传播源和启动时间的挑战。
- 开发一种稳健的方法,以处理未知的感染起始时间、不确定的传播延迟以及真实网络中未观测到的感染路径。
- 在观测稀疏且不完整的情况下,提高源识别的准确性,优于现有方法。
- 实现实时检测社交和信息网络中恶意信息源的能力。
提出的方法
- 该框架首先使用基于似然的方法,从历史级联轨迹中学习连续时间扩散网络模型。
- 然后通过在学习到的模型下最大化观测数据的似然,识别新级联的传播源。
- 使用重要性采样近似来高效估计难以计算的未观测感染路径上的似然积分。
- 优化过程利用问题的结构,高效搜索可能的源节点和启动时间。
- 该方法使用连续时间独立级联(CTIC)模型来捕捉节点之间的随机传播延迟。
- 通过评估给定候选源节点和启动时间的观测感染时间的似然,联合估计源节点及其感染时间。
实验结果
研究问题
- RQ1当仅观测到部分感染时间时,能否准确识别扩散级联的源节点?
- RQ2当绝对启动时间未知时,如何估计级联的真实启动时间?
- RQ3能否将传播延迟建模为随机过程,以提高源检测的鲁棒性?
- RQ4源识别性能如何随观测到的级联数量和观测率的变化而变化?
- RQ5所提出的方法在真实世界扩散数据上相较于最先进方法的性能提升程度如何?
主要发现
- 所提方法在估计真实源感染时间时,均方误差(MSE)约为2000,对应于真实世界网络病毒式传播数据中约45天的均方根误差。
- 在真实世界数据中,该方法在仅观测到6个级联的情况下,仍能实现非零的Top-10成功概率,而NetSleuth等基线方法在相同条件下完全失效。
- 该方法在Top-10成功概率上优于均匀随机猜测12倍,在成功概率上优于均匀随机猜测5倍,表明其具备强大的信号检测能力。
- 在合成网络中,该方法显著降低了源估计误差,尤其在部分观测条件下优于最先进方法。
- 重要性采样近似实现了高效的似然估计,使该方法在可扩展性和实际实时应用中具有可行性。
- 该框架在存在不完整和噪声观测的大规模网络中成功识别出传播源,即使传播延迟为随机且未被观测到。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。