Skip to main content
QUICK REVIEW

[论文解读] Weibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo

Yong Hu, Heyan Huang|arXiv (Cornell University)|May 19, 2020
Data-Driven Disease Surveillance参考文献 15被引用 8
一句话总结

Weibo-COV 是一个大规模、细粒度的微博数据集,包含 4090 万条与 2019 年 12 月 1 日至 2020 年 4 月 30 日期间 COVID-19 相关的微博帖子,采用一种新颖的基于活跃用户池的数据采集方法,绕过了 API 的限制。该数据集包含帖子级别、互动行为、地理位置和转发网络信息,支持对疫情动态、公众情绪和政策影响的全面研究。

ABSTRACT

With the rapid development of COVID-19 around the world, people are requested to maintain "social distance" and "stay at home". In this scenario, extensive social interactions transfer to cyberspace, especially on social media platforms like Twitter and Sina Weibo. People generate posts to share information, express opinions and seek help during the pandemic outbreak, and these kinds of data on social media are valuable for studies to prevent COVID-19 transmissions, such as early warning and outbreaks detection. Therefore, in this paper, we release a novel and fine-grained large-scale COVID-19 social media dataset collected from Sina Weibo, named Weibo-COV, contains more than 40 million posts ranging from December 1, 2019 to April 30, 2020. Moreover, this dataset includes comprehensive information nuggets like post-level information, interactive information, location information, and repost network. We hope this dataset can promote studies of COVID-19 from multiple perspectives and enable better and rapid researches to suppress the spread of this pandemic.

研究动机与目标

  • 为解决 COVID-19 研究中缺乏大规模、公开可用的中文社交媒体数据集,特别是疫情起源地武汉的数据问题。
  • 通过开发一种可扩展的数据采集方法,克服微博官方 API 的限制(其搜索结果输出上限约为 1000 条帖子)。
  • 创建一个高质量、大规模的数据集,以捕捉疫情早期阶段公众情绪、信息传播和社会动态。
  • 利用实时社交媒体数据,支持疾病监测、公众舆论、政策影响及全球传播模式的多样化研究。

提出的方法

  • 通过设定最低阈值(50+ 关注者、50+ 粉丝、50+ 发帖,且最近 30 天内有活动)筛选,构建了包含 2000 万名用户的高质量微博活跃用户池。
  • 在指定时间段(2019 年 12 月 1 日至 2020 年 4 月 30 日)内,收集了这些活跃用户的所有帖子,与基于 API 的方法相比,显著提升了数据量。
  • 使用 179 个与 COVID-19 相关的代表性关键词对帖子进行过滤,以提取相关内容,确保数据集的相关性具有高精度。
  • 获取并结构化了丰富的元数据,包括帖子创建时间、点赞/转发/评论数、地理坐标以及转发网络链接。
  • 动态维护活跃用户池,以确保在整个时间窗口内数据的时效性与可扩展性。
  • 通过 GitHub 发布最终数据集,并附上全面的文档,以支持可复现性及广泛的研究应用。

实验结果

研究问题

  • RQ1从首例确诊病例到疫情高峰,中国社交媒体上关于 COVID-19 的公众情绪和信息传播是如何演变的?
  • RQ2在疫情早期阶段,社交媒体在传播健康信息、谣言和政府政策方面发挥了什么作用?
  • RQ3微博帖子的地理分布如何反映疫情在区域和全球范围内的影响,包括海外华人社区的影响?
  • RQ4在 2020 年 4 月 4 日中国清明节期间,与关键事件相关的帖子在用户互动(点赞、评论、转发)方面呈现出怎样的模式?
  • RQ5大规模、多变量的社交媒体数据如何改善未来疫情的早期预警系统和公共卫生应对策略?

主要发现

  • 该数据集包含 40,893,953 条唯一帖子,其中 1,119,608 条(2.7%)包含地理位置数据,8,284,992 条(20.26%)为原始、非转发内容。
  • 每日帖子数量在 2020 年 1 月 19 日之前低于每天 10,000 条,此后激增至每天超过 200,000 条,于 2020 年 4 月 4 日达到超过 180 万条的峰值。
  • 2020 年 4 月 4 日的峰值与全国哀悼日重合,表明社交媒体上存在强烈的情感表达和纪念活动。
  • 地理分布显示,尽管大多数帖子源自中国,但来自亚洲、欧洲、澳大利亚和美洲的海外地区也出现了显著数量的帖子,反映出全球华人及国际微博用户的广泛参与。
  • 词云分析揭示了公众话语的演变过程:从最初的“不明原因肺炎”到对“新型冠状病毒”的认知,再到对“N95 口罩”等防护措施的关注,后期则聚焦于隔离措施、输入性病例以及“瑞德西韦”等治疗手段。
  • 该数据集覆盖了疫情整个早期阶段,从首例确诊病例到 2020 年 4 月底,支持对信息传播和行为变化的纵向研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。