[论文解读] Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19
Mega-COV 是一个十亿规模的多语言 Twitter 数据集,涵盖 104 种语言和 268 个国家,数据来自 100 万名用户,时间跨度从 2007 年起,具有纵向追踪特性。该数据集支持对疫情相关言论、虚假信息和人类行为的大规模分析,其中两个高精度模型在 COVID 相关性检测上达到 97% 的 F1 值,在虚假信息检测上达到 92% 的 F1 值。
We describe Mega-COV, a billion-scale dataset from Twitter for studying COVID-19. The dataset is diverse (covers 268 countries), longitudinal (goes as back as 2007), multilingual (comes in 100+ languages), and has a significant number of location-tagged tweets (~169M tweets). We release tweet IDs from the dataset. We also develop and release two powerful models, one for identifying whether or not a tweet is related to the pandemic (best F1=97%) and another for detecting misinformation about COVID-19 (best F1=92%). A human annotation study reveals the utility of our models on a subset of Mega-COV. Our data and models can be useful for studying a wide host of phenomena related to the pandemic. Mega-COV and our models are publicly available.
研究动机与目标
- 创建一个大规模、多语言且具备地理位置信息的 Twitter 数据集,覆盖疫情前和疫情期间,以支持纵向分析。
- 通过收集基于用户的内容而非依赖话题标签的数据集,克服现有数据集对话题标签的依赖,确保更广泛的主题和语言多样性。
- 支持对疫情前后人类行为、信息传播及虚假信息扩散的对比研究。
- 开发并验证用于大规模识别疫情相关内容和虚假信息的机器学习模型。
- 公开提供推文 ID 和模型,以支持可复现的大规模研究,探讨 COVID-19 对社会的影响。
提出的方法
- 通过 Twitter API 针对个体用户而非话题标签收集推文,确保更广泛的语言和主题覆盖。
- 从 268 个国家的 100 万名用户中收集数据,对每位用户最长追踪 3,200 条推文,支持疫情前后的对比分析。
- 应用多种语言检测工具识别超过 100 种语言,显著提升语言多样性,超越 Twitter 原生语言代码的 65 种限制。
- 开发基于微调的 Transformer 模型,用于分类推文是否与 COVID-19 相关,在保留测试集上达到 97% 的 F1 值。
- 训练一个独立的二分类器,用于检测关于 COVID-19 的虚假信息,结合语言特征与信号特征,F1 值达到 92%。
- 开展人工标注研究,验证模型性能,并评估在数据集代表性子集上的实用性。
实验结果
研究问题
- RQ1在疫情初期,大规模基于用户的 Twitter 数据集在语言和地理多样性方面,与以话题标签为中心的数据集相比有何差异?
- RQ2在疫情期间,用户行为在多大程度上从原创发推转向更多地转发和回复?
- RQ3在疫情期间,哪些在线新闻网站是信息的主要来源,且其分布如何随地区而异?
- RQ4能否在数据集子集上训练的机器学习模型,实现对疫情相关性和虚假信息检测的高性能大规模识别?
- RQ5从纵向用户数据中,可以得出关于行为变化的哪些洞察,例如在健康、出行或社交互动等话题上的变化?
主要发现
- Mega-COV 包含来自 268 个国家的 100 万名用户约 15 亿条推文,其中超过 1.69 亿条具有地理位置信息,支持全球与区域分析。
- 数据集最早可追溯至 2007 年,支持疫情前基线分析,并实现用户行为的纵向对比。
- 通过语言检测工具识别出超过 100 种不同语言,显著扩展了语言多样性,远超 Twitter 原生语言代码的 65 种限制。
- 研究发现 Twitter 行为发生显著转变:2020 年用户转发和回复的次数超过原创发推,表明传播动态发生变化。
- 国际新闻网站成为信息的主要来源,来自全球主要媒体的内容被高频分享。
- COVID 相关性检测模型达到 97% 的 F1 值,虚假信息检测模型达到 92% 的 F1 值,表明在人工标注子集上表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。