[论文解读] Sockpuppet Detection in Wikipedia: A Corpus of Real-World Deceptive Writing for Linking Identities
本文介绍了首个公开可用的真实世界维基百科傀儡账号欺骗性写作语料库,该语料库通过半自动网络爬取实际管理员调查过程收集而成。利用基于归一化成对特征差异的支持向量机,作者在傀儡账号检测中实现了73%的F1值,为对抗性在线环境中的自动化作者归属研究设立了基准。
This paper describes the corpus of sockpuppet cases we gathered from Wikipedia. A sockpuppet is an online user account created with a fake identity for the purpose of covering abusive behavior and/or subverting the editing regulation process. We used a semi-automated method for crawling and curating a dataset of real sockpuppet investigation cases. To the best of our knowledge, this is the first corpus available on real-world deceptive writing. We describe the process for crawling the data and some preliminary results that can be used as baseline for benchmarking research. The dataset will be released under a Creative Commons license from our project website: http://docsig.cis.uab.edu.
研究动机与目标
- 解决对抗性在线环境中欺骗性写作真实世界数据集匮乏的问题。
- 开发一种自动化傀儡账号检测工具,减少对人工、隐私侵犯性IP检查的依赖。
- 为类似社交媒体内容的短文本对抗性文本提供作者归属的基准数据集。
- 支持在真实欺骗情境下进行文体分析研究,而非人工或自我驱动的混淆手段。
- 支持在线社区中可扩展、保护隐私的检测系统开发。
提出的方法
- 通过半自动网络爬取和整理623个维基百科傀儡账号调查(SPI)案例,数据来源为公开的讨论页讨论。
- 人工筛选排除无讨论页内容的案例,最终获得305个确认的SPI案例和318个非傀儡账号案例。
- 基于编辑评论向量之间的归一化成对差异进行特征工程,包括n-gram、字符级统计量和句法特征。
- 在成对编辑比较上训练支持向量机(SVM)分类器,以判断两名编辑是否极有可能为同一人。
- 采用10折交叉验证评估性能并识别关键特征组。
- 首先评估包含所有特征的基线模型,随后通过逐个移除特征组进行消融分析。
实验结果
研究问题
- RQ1能否可靠地收集并整理出维基百科傀儡账号的真实欺骗性写作,形成公开数据集?
- RQ2在无IP数据支持的情况下,基于文体特征的机器学习方法在检测傀儡账号关系方面效果如何?
- RQ3哪些特征组对傀儡账号检测性能贡献最为显著?
- RQ4该数据集能否作为对抗性环境下作者归属的现实基准?
- RQ5在真实世界数据上的表现与人工或自我混淆数据集相比如何?
主要发现
- 最终语料库包含623个案例,其中305个为确认的傀儡账号案例,318个为非傀儡账号案例,平均每个案例180条评论,每位编辑平均83条评论。
- 该数据集已以知识共享许可协议公开发布,供研究使用。
- 使用所有特征组的支持向量机分类器实现了73%的F1值,为未来研究提供了强有力的基线。
- 移除任一特征组均导致性能下降,表明每组特征均对检测准确率有显著贡献。
- 该语料库是首个真实世界短文本对抗性语料库,作者有意隐藏身份,因此在社交媒体和安全应用中具有高度相关性。
- 结果表明,仅使用文本特征即可实现自动化傀儡账号检测,显著减少对管理员IP地址访问权限的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。