[论文解读] VoterFraud2020: a Multi-modal Dataset of Election Fraud Claims on Twitter
本文介绍了 VoterFraud2020,这是一个大规模多模态数据集,包含 760 万条与 2020 年美国大选欺诈指控相关的推文及 256 万条转发,时间范围为 2020 年 10 月 23 日至 12 月 16 日。该数据集通过转发关系构建的用户聚类、用户封禁状态、16.8 万张图片的感知哈希值,以及 13.8 万条外部链接和 1.2 万条 YouTube 视频的聚合元数据进行了增强,支持对虚假信息传播网络及平台应对措施的分析。
The wide spread of unfounded election fraud claims surrounding the U.S. 2020 election had resulted in undermining of trust in the election, culminating in violence inside the U.S. capitol. Under these circumstances, it is critical to understand the discussions surrounding these claims on Twitter, a major platform where the claims were disseminated. To this end, we collected and released the VoterFraud2020 dataset, a multi-modal dataset with 7.6M tweets and 25.6M retweets from 2.6M users related to voter fraud claims. To make this data immediately useful for a diverse set of research projects, we further enhance the data with cluster labels computed from the retweet graph, each user's suspension status, and the perceptual hashes of tweeted images. The dataset also includes aggregate data for all external links and YouTube videos that appear in the tweets. Preliminary analyses of the data show that Twitter's user suspension actions mostly affected a specific community of voter fraud claim promoters, and exposes the most common URLs, images and YouTube videos shared in the data.
研究动机与目标
- 为解决与 1 月 6 日国会暴动相关的不实选举欺诈指控传播所引发的紧迫研究需求,提供实证数据。
- 在 API 限制的背景下,收集并发布一个全面的、多模态的推特讨论数据集,涵盖 2020 年美国大选欺诈指控。
- 通过添加可操作的标签——用户聚类、封禁状态、图像感知哈希值和链接元数据——增强原始数据,提升其研究实用性。
- 使研究人员能够研究虚假信息传播网络的结构、平台内容管理的影响,以及视觉和视频内容在传播指控中的作用。
- 支持关于选举诚信、虚假信息及在高风险民主事件中内容管理政策有效性的学术研究。
提出的方法
- 通过 55 天窗口(2020 年 10 月 23 日至 12 月 16 日)的推特流媒体 API,使用基于数据驱动并人工校准的关键词集合(如 'voter fraud'、'#stopthesteal')收集推文。
- 基于 API 速率限制和抽样验证,估算数据覆盖范围约为所有含目标关键词推文的 60%。
- 利用基于转发图的聚类算法计算用户社区标签,以识别连贯的讨论网络。
- 获取并整合截至 2021 年 1 月 10 日的用户封禁状态,以分析平台管理措施的影响。
- 为数据集中 16.8 万张图片生成感知哈希值,以支持视觉相似性分析和图像追踪。
- 聚合 13.8 万条外部链接和 1.2 万条唯一 YouTube 视频的元数据,包括视频 ID、URL 和互动指标。
实验结果
研究问题
- RQ1哪些用户群体在推动选举欺诈指控方面最为活跃,Twitter 的封禁行动如何影响这些群体?
- RQ2与选举欺诈指控相关的视觉和视频内容中,哪些类型被最广泛传播,其传播范围和相似性如何比较?
- RQ3欺诈指控传播者引用的外部链接在可信度和传播范围方面有何差异,特别是指向 YouTube 和低质量新闻网站的链接?
- RQ4平台管理措施(如用户封禁)在多大程度上针对性地作用于传播选举欺诈叙事的特定用户群?
- RQ5与欺诈指控相关的最广泛转发的图片和视频在视觉内容和传播模式上有哪些差异?
主要发现
- 一个主要与 QAnon 相关的、推动选举欺诈指控的显著用户群被 Twitter 封禁措施 disproportionately 针对,该群体中近 7.8% 的用户被封禁。
- 基于转发量最广泛的图片与转发次数最多的图片在视觉上存在明显差异,表明其在病毒式传播中采用了不同的视觉策略。
- 传播选举欺诈指控的十大 YouTube 频道规模虽小,但传播范围极大,且截至 2021 年 1 月 11 日全部仍处于活跃状态。
- 指控传播者引用的外部链接主要指向低质量新闻网站、流媒体服务和 YouTube,主流媒体的占比极低。
- 该数据集通过增强标签(包括封禁状态和感知哈希值)使研究人员能够识别并分析驱动虚假信息传播的核心网络。
- 尽管 Twitter 已删除被封禁用户的推文,但公开数据集仍保留了推文 ID 和图像哈希值,使学术研究能够以合乎伦理的方式访问关键内容。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。