[论文解读] Detection of Fake Users in SMPs Using NLP and Graph Embeddings
本文提出了一种新颖的Twitter垃圾信息检测方法,结合用户元数据、NLP提取的文本特征以及关注-被关注关系网络的图嵌入,以区分真实用户与虚假用户。在新收集的、最新的46,354个活跃账户数据集上使用XGBoost模型,该方法实现了96.99%的准确率,优于以往在更新、更具挑战性数据上的工作成果。
Social Media Platforms (SMPs) like Facebook, Twitter, Instagram etc. have large user base all around the world that generates huge amount of data every second. This includes a lot of posts by fake and spam users, typically used by many organisations around the globe to have competitive edge over others. In this work, we aim at detecting such user accounts in Twitter using a novel approach. We show how to distinguish between Genuine and Spam accounts in Twitter using a combination of Graph Representation Learning and Natural Language Processing techniques.
研究动机与目标
- 解决现代虚假和垃圾Twitter账号检测的挑战,这些账号已演化至可规避传统检测系统。
- 克服现有数据集的局限性,即依赖过时或已停用的账号,无法反映当前的垃圾信息行为。
- 开发一种结合用户元数据、NLP技术与基于图的表征的鲁棒检测框架,以提升在当前活跃账号上的检测准确率。
- 创建一个全新、最新的46,354个活跃Twitter账号数据集——其中许多账号已通过Twitter自身的垃圾信息过滤机制——用于模型的训练与评估,以实现对现实且难以检测的垃圾账号的建模。
提出的方法
- 从公开来源和Twitter API收集了126,503个Twitter用户ID,过滤掉不活跃账号后保留46,354个具有验证标签的活跃账号。
- 通过Twitter API提取每位用户的37项元数据特征(如关注者数量、认证状态、账号创建日期)及完整推文内容。
- 使用TF-IDF和基于BERT的句子嵌入生成NLP特征,以捕捉推文内容中的语言模式。
- 基于用户连接关系构建关注-被关注图,并计算图中心性度量(度数、中间性、特征向量中心性、PageRank)以及node2vec嵌入,以捕捉网络中的结构角色。
- 将元数据、NLP和图特征整合为每个用户的统一特征向量(116维)作为模型输入。
- 训练并评估多种监督式机器学习模型,最终通过网格搜索进行超参数调优,选定XGBoost为最佳性能模型(学习率0.1,最大深度15)。
实验结果
研究问题
- RQ1结合NLP、用户元数据与图嵌入的混合方法,能否有效检测出已规避先前检测系统的现代虚假Twitter账号?
- RQ2当在新近的活跃账号数据集(其中许多已通过Twitter自身的垃圾信息过滤机制)上训练时,模型性能相较于旧数据集有何变化?
- RQ3基于图的结构特征(如中心性、node2vec嵌入)在多大程度上提升了垃圾信息检测效果,超越传统元数据与NLP特征?
- RQ4与更简单的NLP方法相比,BERT-based嵌入的集成是否显著增强了模型检测垃圾内容中细微语言模式的能力?
- RQ5在这一新近且具有挑战性的活跃账号数据集上,XGBoost的性能与其它SOTA模型(如SVM、随机森林、GBM)相比如何?
主要发现
- XGBoost模型在测试集上达到最高的96.99%准确率,显著优于其他模型,如随机森林(94.98%)和LightGBM(88.49%)。
- 模型在类别1(垃圾账号)上达到97.90%的准确率,表明其对恶意账号具有强大的检测能力,即使这些账号当前处于活跃状态且已规避平台级过滤机制。
- 所提出的方法在更大且更新的46,354个活跃账号数据集上优于以往研究,如Igawa等人(96.6%)和Varol等人(95%),展现出更强的泛化能力。
- 模型的F1-score为0.97,表明在真实与垃圾账号类别之间实现了良好的平衡,反映出高精确率与高召回率。
- node2vec图嵌入与NLP特征(尤其是基于BERT的嵌入)在区分垃圾信息模式方面贡献显著,特别是在群体行为模式与语言风格方面。
- 该数据集的质量——仅包含通过Twitter自身垃圾信息检测的活跃账号——使得96.99%的准确率结果尤为突出,因为它反映了对复杂、难以检测的垃圾账号的有效识别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。