[论文解读] Follow Spam Detection based on Cascaded Social Information
本文提出一种基于级联社交信息的检测方法,通过分析局部两跳社交网络来识别Twitter上的关注垃圾信息。该方法引入TSP-过滤(基于三角形显著性图谱)和SS-过滤(基于社交地位理论),并通过集成方法——级联过滤,实现在真实Twitter数据上的96.3%真正例率和5.7%假正例率,优于以往方法且计算成本更低。
In the last decade we have witnessed the explosive growth of online social networking services (SNSs) such as Facebook, Twitter, RenRen and LinkedIn. While SNSs provide diverse benefits for example, forstering interpersonal relationships, community formations and news propagation, they also attracted uninvited nuiance. Spammers abuse SNSs as vehicles to spread spams rapidly and widely. Spams, unsolicited or inappropriate messages, significantly impair the credibility and reliability of services. Therefore, detecting spammers has become an urgent and critical issue in SNSs. This paper deals with Follow spam in Twitter. Instead of spreading annoying messages to the public, a spammer follows (subscribes to) legitimate users, and followed a legitimate user. Based on the assumption that the online relationships of spammers are different from those of legitimate users, we proposed classification schemes that detect follow spammers. Particularly, we focused on cascaded social relations and devised two schemes, TSP-Filtering and SS-Filtering, each of which utilizes Triad Significance Profile (TSP) and Social status (SS) in a two-hop subnetwork centered at each other. We also propose an emsemble technique, Cascaded-Filtering, that combine both TSP and SS properties. Our experiments on real Twitter datasets demonstrated that the proposed three approaches are very practical. The proposed schemes are scalable because instead of analyzing the whole network, they inspect user-centered two hop social networks. Our performance study showed that proposed methods yield significantly better performance than prior scheme in terms of true positives and false positives.
研究动机与目标
- 应对Twitter上关注垃圾信息日益增长的威胁,即垃圾信息发送者通过关注合法用户以提升曝光度并传播垃圾信息。
- 克服基于内容的垃圾信息检测方法的局限性,后者在面对包含网址和图片的演变消息模式时失效。
- 开发一种可扩展的、实时的垃圾信息检测机制,利用局部网络结构而非全局网络分析。
- 探究局部两跳社交网络中的结构差异是否能有效区分垃圾信息发送者与合法用户。
- 提出并评估一种结合三角形显著性图谱(TSP)和社会地位(SS)理论的混合检测框架,以提升检测准确率。
提出的方法
- 使用三角形显著性图谱(TSP)测量每个用户两跳社交网络中13种同构子图(三角形)的频率与分布,以检测结构异常。
- 应用社交地位(SS)理论建模关注行为:合法用户倾向于关注地位更高的用户,而垃圾信息发送者则随机关注,从而基于地位失衡实现分类。
- 设计TSP-过滤与SS-过滤作为独立的检测方案,各自分析以用户为中心的两跳子网络,以降低计算负载。
- 通过集成技术——级联过滤,结合TSP与SS特征,利用互补的结构信号提升检测性能。
- 在真实Twitter数据集上训练并评估模型,聚焦于局部网络结构,以确保可扩展性与实时适用性。
- 探索使用自组织映射(SOM)的无监督扩展方法,基于与已知垃圾信息发送者模式的相似性,动态聚类新账户。
实验结果
研究问题
- RQ1局部两跳社交网络结构能否有效区分Twitter上的关注垃圾信息发送者与合法用户?
- RQ2局部网络中的三角形显著性图谱(TSP)在多大程度上可作为检测关注垃圾信息的区分性特征?
- RQ3社交地位理论如何帮助识别那些无视地位层级而随意关注用户的垃圾信息发送者?
- RQ4通过集成学习结合TSP与SS特征,是否能显著提升检测准确率,相较于单一方法?
- RQ5鉴于该方法依赖局部网络分析而非全局网络计算,其可扩展性如何,是否适合实时部署?
主要发现
- 仅使用TSP-过滤方法,即可通过两跳局部网络结构实现92.1%的分类准确率,有效识别垃圾信息发送者。
- SS-过滤方法通过识别与社交地位层级不一致的异常关注行为,有效检测垃圾信息发送者。
- 混合的级联过滤方法实现了96.3%的真正例率和仅5.7%的假正例率,显著优于CollusionRank基线方法。
- 所提方法仅需局部网络数据,因此具备可扩展性,适合在大规模社交网络环境中实时部署。
- 结果证实,垃圾信息发送者网络在级联社交信息中表现出独特的结构与行为模式,验证了该方法的核心假设。
- 未来工作表明,该框架有潜力扩展至检测其他恶意行为(如虚假谣言传播),方法类似结构分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。