[论文解读] Who Falls for Online Political Manipulation?
本研究利用Twitter数据,开发了一种机器学习模型,以预测2016年美国大选期间易受俄罗斯网络水军内容影响而传播的用户。通过结合政治意识形态、机器人可能性评分和用户活跃度指标,该模型在识别内容传播者方面实现了96%的AUC,表明这些特征对预测在线政治操纵的易感性具有高度预测力。
Social media, once hailed as a vehicle for democratization and the promotion of positive social change across the globe, are under attack for becoming a tool of political manipulation and spread of disinformation. A case in point is the alleged use of trolls by Russia to spread malicious content in Western elections. This paper examines the Russian interference campaign in the 2016 US presidential election on Twitter. Our aim is twofold: first, we test whether predicting users who spread trolls' content is feasible in order to gain insight on how to contain their influence in the future; second, we identify features that are most predictive of users who either intentionally or unintentionally play a vital role in spreading this malicious content. We collected a dataset with over 43 million elections-related posts shared on Twitter between September 16 and November 9, 2016, by about 5.7 million users. This dataset includes accounts associated with the Russian trolls identified by the US Congress. Proposed models are able to very accurately identify users who spread the trolls' content (average AUC score of 96%, using 10-fold validation). We show that political ideology, bot likelihood scores, and some activity-related account meta data are the most predictive features of whether a user spreads trolls' content or not.
研究动机与目标
- 探究是否能够在用户实际传播俄罗斯网络水军内容之前预测其传播行为。
- 识别出最能区分用户是否故意或无意传播恶意政治内容的特征。
- 为早期预警系统的发展提供依据,以减轻社交媒体上虚假信息的传播。
- 理解政治意识形态、机器人行为和用户活跃度在易感性中的作用。
提出的方法
- 通过基于关键词和话题标签的Twitter API查询,收集了2016年9月16日至11月9日期间,来自570万名用户的4300万条与选举相关推文。
- 将数据集与美国国会公布的221个俄罗斯网络水军账户列表交叉比对,以识别其发布的相关内容。
- 基于用户层面的特征(如政治意识形态、粉丝数、推文数量和机器人可能性评分)训练了多种机器学习分类器,包括梯度提升(Gradient Boosting)。
- 使用10折交叉验证评估模型性能,以曲线下面积(AUC)为主要指标。
- 通过部分依赖分析解释特征重要性及模型行为,尤其关注政治意识形态和机器人评分的影响。
- 在平衡子集和完整数据集上验证结果,包括存在缺失值的情况,以确保模型的稳健性。
实验结果
研究问题
- RQ1我们能否预测在2016年美国大选期间,哪些用户会变得易受俄罗斯网络水军内容影响而传播?
- RQ2哪些用户层面的特征最能预测用户是否会传播俄罗斯网络水军的内容?
- RQ3政治意识形态、机器人行为和用户活跃度水平在多大程度上影响用户对操纵的易感性?
- RQ4机器学习模型在多大程度上能够区分传播网络水军内容的用户与未传播的用户?
主要发现
- 该模型在使用全部特征和梯度提升方法时,平均AUC得分为96%,能够有效区分传播俄罗斯网络水军内容的用户与未传播的用户。
- 政治意识形态是最具预测力的特征,倾向保守的用户表现出更高的传播易感性。
- 机器人可能性评分和用户活跃度指标(如推文数量和粉丝数)也是最重要的预测特征之一。
- 传播网络水军内容的用户通常活跃度较高(发布大量推文)、机器人评分较高,且更倾向保守,尽管他们原创推文较少、粉丝数也较少。
- 即使在完整数据集上,或在排除缺失值的行后,模型性能仍保持在90%以上的AUC,表明其具有良好的稳健性。
- 部分依赖图确认,政治意识形态对模型预测的影响最强,其次是粉丝数和账户年龄。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。