[论文解读] EDNA-Covid: A Large-Scale Covid-19 Tweets Dataset Collected with the EDNA Streaming Toolkit
本文介绍了EDNA-Covid,这是一个大规模、多语言的Twitter数据集,包含超过6亿条推文,自2020年1月起通过EDNA流处理工具包收集。该数据集捕捉了疫情话语的动态演变,表现出明显的概念漂移现象,支持实时自然语言处理、虚假信息检测和动态数据分布下的流式分析研究。
The Covid-19 pandemic has fundamentally altered many facets of our lives. With nationwide lockdowns and stay-at-home advisories, conversations about the pandemic have naturally moved to social networks, e.g. Twitter. This affords an unprecedented insight into the evolution of social discourse in the presence of a long-running destabilizing factor such as a pandemic with the high-volume, high-velocity, high-noise Covid-19 Twitter feed. However, real-time information extraction from such a data stream requires a fault-tolerant streaming infrastructure to perform the non-trivial integration of heterogenous data sources from news organizations, social feeds, and authoritative medical organizations like the CDC. To address this, we present (i) the EDNA streaming toolkit for consuming and processing streaming data, and (ii) EDNA-Covid, a multilingual, large-scale dataset of coronavirus-related tweets collected with EDNA since January 25, 2020. EDNA-Covid includes, at time of this publication, over 600M tweets from around the world in over 10 languages. We release both the EDNA toolkit and the EDNA-Covid dataset to the public so that they can be used to extract valuable insights on this extraordinary social event.
研究动机与目标
- 为应对在持续的新冠疫情背景下,对高吞吐量、高噪声社交媒体数据进行实时、容错摄入与处理的挑战。
- 为流式自然语言处理、虚假信息检测和社会动态研究,提供大规模、多语言且存在概念漂移的数据集。
- 通过真实世界的流数据,支持机器学习模型中概念漂移检测与适应机制的开发与测试。
- 通过在受控访问下发布EDNA流处理工具包和EDNA-Covid数据集,支持可复现的研究。
提出的方法
- EDNA是一种基于摄入-处理-发出流水线架构的流处理工具包,支持对实时数据流进行容错、可扩展的处理。
- 该工具包通过DAG(有向无环图)方式组合EDNA作业,每个作业封装了摄入、转换和发出操作,实现模块化的流式处理。
- EDNA-Covid通过基于关键词的过滤方式摄入Twitter数据,并并行化提取元数据,同时通过Redis动态更新虚假信息关键词缓存。
- 系统采用多阶段流水线:从Twitter摄入数据,提取元数据,筛选与关键词(如“covid”、“pandemic”)相关的推文,利用来自维基百科和前期研究的精选关键词列表检测虚假信息。
- 通过关键词频率的时间序列分析捕捉概念漂移,显示话语从“Wuhan”等起源相关术语,逐步转向“mask”、“pandemic”等疾病与政策相关术语。
- 数据仅通过推文ID发布,符合Twitter的服务条款,完整推文需借助twarc等工具进行还原,GitHub上已公开部分样本。
实验结果
研究问题
- RQ1如何通过容错的流式基础设施,在全球疫情事件期间高效收集并处理高吞吐量、多语言的社交媒体数据?
- RQ2关于新冠疫情的Twitter话语在时间上表现出多大程度的概念漂移?这种漂移在实时数据中如何被定量观测?
- RQ3从疫情初期的困惑到政策辩论与虚假信息传播,公众在Twitter上的语言与主题发生了哪些关键转变?
- RQ4像EDNA这样的流式工具包如何支持对动态演变的社交媒体数据进行实时分析,包括虚假信息检测与主题建模?
- RQ5在构建可扩展、生产就绪的流式处理管道以实现大规模社交媒体数据采集时,面临哪些实际挑战与设计考量?
主要发现
- EDNA-Covid包含自2020年1月25日至2020年9月30日期间收集的超过6亿条推文,覆盖10多种语言,其中英语占63.4%。
- 该数据集表现出明显的概念漂移,关键词频率随时间变化:1月以“Wuhan”为主,2月转向“Covid-19”,3月变为“pandemic”,7月则转向“mask”,反映出公众话语的演变。
- 西班牙语、南亚语言(印尼语、爪哇语、马来语)、法语和葡萄牙语为接下来最常出现的语言,合计占数据集的12.0%。
- 通过来自维基百科和前期研究的关键词列表动态更新缓存,支持虚假信息检测,实时过滤在数据摄入阶段即被应用。
- 2020年6月引入的并行化元数据提取流水线显著降低了推文丢失率,提升了数据采集效率。
- 由于遵循Twitter的服务条款,仅通过注册流程向公众发布推文ID,完整推文需借助twarc等外部工具进行还原。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。