[论文解读] Identification of Source of Rumors in Social Networks with Incomplete Information
本文提出了一种新颖的方法,用于在传感器数据不完整的大规模社交网络中识别谣言来源,利用压缩感知和双非负(DN)矩阵补全技术恢复缺失的谣言到达时间。该方法即使在高达30%的数据缺失情况下,也能实现接近最大似然估计器的性能,是首次在社交网络中针对不完整信息下的谣言来源识别研究。
Rumor source identification in large social networks has received significant attention lately. Most recent works deal with the scale of the problem by observing a subset of the nodes in the network, called sensors, to estimate the source. This paper addresses the problem of locating the source of a rumor in large social networks where some of these sensor nodes have failed. We estimate the missing information about the sensors using doubly non-negative (DN) matrix completion and compressed sensing techniques. This is then used to identify the actual source by using a maximum likelihood estimator we developed earlier, on a large data set from Sina Weibo. Results indicate that the estimation techniques result in almost as good a performance of the ML estimator as for the network for which complete information is available. To the best of our knowledge, this is the first research work on source identification with incomplete information in social networks.
研究动机与目标
- 解决在因隐私限制或数据访问限制导致传感器数据不完整时,识别大规模社交网络中谣言来源的挑战。
- 开发稳健的方法,以恢复社交网络中传感器节点缺失的谣言到达时间测量值。
- 在真实社交网络数据上评估估计技术(压缩感知、DN矩阵补全及基于更新理论的增强方法)的性能。
- 证明即使在显著的数据缺失率下,来源定位精度仍与完整数据情况下的性能几乎相当。
提出的方法
- 使用压缩感知技术恢复观测向量Δt中零星缺失的谣言到达时间条目。
- 应用双非负(DN)矩阵补全技术,以恢复以突发或结构化块形式缺失的数据条目。
- 结合基于更新理论的模型,利用传播间隔的前两阶矩,提升DN补全的准确性。
- 采用先前为来源定位开发的最大似然(ML)估计器,将恢复后的数据作为输入。
- 利用Louvain方法从社区结构中构建网关图,并选择介数中心性高的节点作为传感器。
- 在包含40,445至43,545个节点、80,923至84,451条边、直径最高达13的Sina Weibo真实数据集上验证该框架。
实验结果
研究问题
- RQ1压缩感知能否有效恢复社交网络中零星缺失的谣言到达时间测量值?
- RQ2双非负矩阵补全能否处理谣言传播网络中突发性或块状缺失的数据?
- RQ3结合更新理论是否能提升谣言来源识别中缺失数据估计的准确性?
- RQ4当使用估计数据而非完整传感器数据时,ML估计器的性能会如何退化?
- RQ5在高数据缺失率下,估计技术在多大程度上能保持来源定位的准确性?
主要发现
- 当传感器密度低于0.3%时,压缩感知在15%与30%缺失率下的估计误差几乎无法区分。
- 基于更新理论的DN矩阵补全在15%缺失率下的估计误差降低幅度,显著高于30%缺失率。
- 基于更新理论的模型通过利用传播间隔的一阶和二阶矩,优于标准DN补全,从而产生更低的估计误差。
- 即使在30%的数据缺失情况下,使用压缩感知的来源定位性能仍能保持在真实来源的几跳范围内,与完整信息场景相比,几乎达到完全准确。
- 基于更新理论的DN补全方法在较低缺失率下,比标准DN补全更有效地降低平均来源估计误差。
- 总体而言,估计技术使ML估计器的性能几乎与完整信息情况相同,验证了所提框架的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。