Skip to main content
QUICK REVIEW

[论文解读] Fighting the COVID-19 Infodemic in Social Media: A Holistic Perspective and a Call to Arms

Firoj Alam, Fahim Dalvi|arXiv (Cornell University)|Jul 15, 2020
Misinformation and Its Impacts被引用 15
一句话总结

本文提出了一套全面的多重视角标注框架,旨在通过在多语言众包平台上对推文进行七个维度(事实性、危害潜力、公共利益等)的标注,应对社交媒体上的新冠虚假信息泛滥问题。该框架在使用变换器模型时显著优于基线方法,尤其在多分类设置中表现突出,并呼吁全球社区参与推文标注,以支持事实核查和公共卫生工作。

ABSTRACT

With the outbreak of the COVID-19 pandemic, people turned to social media to read and to share timely information including statistics, warnings, advice, and inspirational stories. Unfortunately, alongside all this useful information, there was also a new blending of medical and political misinformation and disinformation, which gave rise to the first global infodemic. While fighting this infodemic is typically thought of in terms of factuality, the problem is much broader as malicious content includes not only fake news, rumors, and conspiracy theories, but also promotion of fake cures, panic, racism, xenophobia, and mistrust in the authorities, among others. This is a complex problem that needs a holistic approach combining the perspectives of journalists, fact-checkers, policymakers, government entities, social media platforms, and society as a whole. Taking them into account we define an annotation schema and detailed annotation instructions, which reflect these perspectives. We performed initial annotations using this schema, and our initial experiments demonstrated sizable improvements over the baselines. Now, we issue a call to arms to the research community and beyond to join the fight by supporting our crowdsourcing annotation efforts.

研究动机与目标

  • 为应对新冠虚假信息泛滥的复杂多维特性,该问题不仅限于虚假事实,还涵盖恐慌、种族主义和有害疗法等。
  • 开发一个综合的标注方案,整合记者、事实核查员、政策制定者、社交媒体平台及社会大众的多重视角。
  • 通过基于志愿者的多语言众包平台(基于MicroMappers构建)降低标注负担并提升标注质量。
  • 创建公开可用的、高质量的英阿双语数据集,用于训练和评估虚假信息检测模型。
  • 支持开发稳健的自然语言处理模型,以检测不仅虚假声明,还包括潜在有害或具有社会意义的内容。

提出的方法

  • 作者定义了一个涵盖七个问题的标注方案,包括可验证声明、虚假可能性、公共利益、危害潜力、事实核查需求、社会危害和政府关注。
  • 他们利用MicroMappers框架构建多语言众包平台,从志愿者处收集英文和阿拉伯文推文的标注。
  • 标注过程采用多名标注员对每个样本进行标注,以确保可靠性并应对标注中的主观性。
  • 他们在二分类和多分类任务上训练并评估了多种自然语言处理模型,包括BERT、RoBERTa、mBERT、ALBERT、XLM-R、AraBERT和FastText。
  • 在模型训练中,他们使用默认设置对变换器模型进行三轮微调,并根据验证集表现选择最佳模型。
  • 他们使用加权F1分数作为评估指标,以应对数据集中类别不平衡的问题。

实验结果

研究问题

  • RQ1多维标注方案如何有效捕捉新冠虚假信息泛滥中超越简单事实性的多样化有害内容形式?
  • RQ2多语言众包标注对虚假信息检测数据集的质量和可扩展性有何影响?
  • RQ3不同预训练语言模型在检测关于新冠的推文中各种类型有害或重要内容方面的表现如何?
  • RQ4在二分类和多分类设置中,基于此多标签方案训练的模型是否能超越基线方法?
  • RQ5在低资源或词形复杂的语言(如阿拉伯语)中,字符级嵌入(如FastText)在多大程度上优于基于变换器的模型?

主要发现

  • 所有基于变换器的模型在英文和阿拉伯文数据集上均优于多数类别基线,证实了迁移学习在虚假信息泛滥检测中的有效性。
  • 在二分类任务中,BERT和RoBERTa在大多数英文任务中表现最佳,而mBERT在七项任务中的四项中优于其他模型。
  • 在多分类任务中,mBERT在六项任务中的四项上取得了最高的F1分数,表明其在复杂标签空间中具有强大的泛化能力。
  • 在阿拉伯文任务中,FastText在多项任务中优于所有变换器模型,可能因其对语言中形态变化和拼写错误的鲁棒性。
  • 多语言mBERT模型在两种语言中均表现出色,表明其在跨语言虚假信息检测中的潜力。
  • 本研究证明,将超越真实性的社会和平台相关维度纳入,可显著提升检测系统在现实应用中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。