Skip to main content
QUICK REVIEW

[论文解读] Fighting the COVID-19 Infodemic: Modeling the Perspective of Journalists, Fact-Checkers, Social Media Platforms, Policy Makers, and the Society

Firoj Alam, Shaden Shaar|arXiv (Cornell University)|Apr 30, 2020
Misinformation and Its Impacts被引用 4
一句话总结

本文提出一个包含16,000条人工标注的多语言、多利益相关方的COVID-19推文数据集,涵盖阿拉伯语、保加利亚语、荷兰语和英语,旨在支持记者、事实核查员、社交媒体平台、政策制定者及社会公众等多方视角下的细粒度虚假信息分析。该研究采用预训练的Transformer模型进行多语言与多任务学习,表现优异,在英语中多分类声明真实性分类任务上达到87.7%的F1分数,在英语中行动号召检测任务上达到81.8%的F1分数。

ABSTRACT

With the emergence of the COVID-19 pandemic, the political and the medical aspects of disinformation merged as the problem got elevated to a whole new level to become the first global infodemic. Fighting this infodemic has been declared one of the most important focus areas of the World Health Organization, with dangers ranging from promoting fake cures, rumors, and conspiracy theories to spreading xenophobia and panic. Addressing the issue requires solving a number of challenging problems such as identifying messages containing claims, determining their check-worthiness and factuality, and their potential to do harm as well as the nature of that harm, to mention just a few. To address this gap, we release a large dataset of 16K manually annotated tweets for fine-grained disinformation analysis that (i) focuses on COVID-19, (ii) combines the perspectives and the interests of journalists, fact-checkers, social media platforms, policy makers, and society, and (iii) covers Arabic, Bulgarian, Dutch, and English. Finally, we show strong evaluation results using pretrained Transformers, thus confirming the practical utility of the dataset in monolingual vs. multilingual, and single task vs. multitask settings.

研究动机与目标

  • 为应对COVID-19疫情期间的全球‘信息疫情’,创建一个能从多个利益相关方视角捕捉虚假信息的数据集。
  • 设计一个全面的标注方案,整合记者、事实核查员、社交媒体平台、政策制定者及公众的需求。
  • 通过建模可核查性、真实性、危害性以及行动号召等维度,实现对多语言社交媒体内容中虚假信息的细粒度分析。
  • 通过采用最先进的Transformer模型进行多语言与多任务学习,建立强有力的性能基准,评估该数据集的实用性。

提出的方法

  • 使用涵盖声明真实性、可核查性、危害性及政策相关性等维度的七问标注框架,在四种语言(阿拉伯语、保加利亚语、荷兰语、英语)中对16,000条推文进行标注。
  • 通过与记者、事实核查员以及公共卫生部的多方利益相关者协商,制定标注指南,确保其在现实场景中的相关性。
  • 采用多标签、多任务学习框架,联合预测声明真实性、可核查性、危害性潜力以及行动号召意图。
  • 在单语和多语言设置下,训练并评估多种模型,包括BERT、mBERT、XLM-RoBERTa、FastText和BERTje。
  • 引入社会语境和宣传性语言线索,以提升模型在虚假信息检测任务中的表现。
  • 将数据集和代码在GitHub上公开发布,以支持可复现性,并推动多语言虚假信息检测领域的进一步研究。

实验结果

研究问题

  • RQ1多语言、多利益相关方的数据集在应对全球公共卫生危机期间的社交媒体虚假信息检测中,能发挥怎样的作用?
  • RQ2在细粒度虚假信息分类任务中,多任务学习与跨语言学习能带来多大的性能提升?
  • RQ3社会语境和语言线索(如宣传性语言)如何影响对推文中具有危害性或可核查性声明的检测?
  • RQ4在COVID-19虚假信息背景下,预训练的Transformer模型在跨语言和跨任务场景下的泛化能力如何?
  • RQ5统一的标注方案能否有效捕捉记者、事实核查员、政策制定者及公众的多样化需求?

主要发现

  • 该数据集在多语言虚假信息检测任务中表现优异,XLM-RoBERTa在英语中的多分类声明真实性分类任务上达到87.7%的F1分数。
  • 多任务学习显著提升了模型性能,XLM-RoBERTa在英语中行动号召检测(Q7)任务上达到81.8%的F1分数,优于基线模型。
  • 跨语言迁移学习展现出显著优势,mBERT在荷兰语的Q7(行动号召)任务上达到84.4%的F1分数,表明其具备强大的零样本泛化能力。
  • 通过建模宣传性语言和社交语境,显著提升了在所有语言中对有害性及可核查性声明的检测效果。
  • 该数据集展现出较高的标注者间一致性与实际应用价值,基于BERT的模型在英语和荷兰语的大多数任务中F1分数均超过80%。
  • 该数据集与代码在GitHub上的发布,支持了可复现性,并为多语言虚假信息检测及政策相关自然语言处理研究提供了重要支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。