[论文解读] FakeCovid -- A Multilingual Cross-domain Fact Check News Dataset for COVID-19
介绍 FakeCovid,这是一个多语言跨领域数据集,包含来自 92 个站点、覆盖 40 种语言、涉及 105 个国家的 5,182 条经过事实核查的 COVID-19 文章,并提供一个基线分类器,在检测假新闻方面达到 F1 为 0.76。
In this paper, we present a first multilingual cross-domain dataset of 5182 fact-checked news articles for COVID-19, collected from 04/01/2020 to 15/05/2020. We have collected the fact-checked articles from 92 different fact-checking websites after obtaining references from Poynter and Snopes. We have manually annotated articles into 11 different categories of the fact-checked news according to their content. The dataset is in 40 languages from 105 countries. We have built a classifier to detect fake news and present results for the automatic fake news detection and its class. Our model achieves an F1 score of 0.76 to detect the false class and other fact check articles. The FakeCovid dataset is available at Github.
研究动机与目标
- 从多个领域和来源创建一个大规模多语言的经事实核查的 COVID-19 新闻数据集。
- 将文章按内容类别进行注释,以支持跨领域分析。
- 提供一个跨语言的自动化假新闻检测基线模型。
- 使分析 COVID-19 信息误导的跨语言和跨国家特征成为可能。
提出的方法
- 收集来自 92 个事实核查网站的 5,182 条经核查的 COVID-19 文章。
- 以 Poynter 和 Snopes 的来源来整理文章(04/01/2020–15/05/2020)。
- 将文章手动注释为 11 个内容类别。
- 确保覆盖 40 种语言和 105 个国家的多语言覆盖。
- 训练一个分类器来检测假新闻,并报告其在 false 类和其他事实核查类别上的性能。
实验结果
研究问题
- RQ1一个多语言、跨领域的 COVID-19 事实核查新闻数据集在语言和国家层面上的分布是怎样的?
- RQ2在该数据集上训练的分类器能否在跨语言的条件下有效地区分假新闻与其他经过核查的内容?
- RQ3这11个内容类别在语言和领域中的分布和特征是什么?
主要发现
- 该数据集包含 5,182 条经核查的 COVID-19 文章。
- 文章来自 92 个事实核查网站。
- 数据覆盖 40 种语言,涉及 105 个国家。
- 在 FakeCovid 上训练的分类器在检测假新闻和其他事实核查文章方面达到 F1 分数 0.76。
- 该数据集可在 GitHub 公共使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。