Skip to main content
QUICK REVIEW

[论文解读] VaccineLies: A Natural Language Resource for Learning to Recognize Misinformation about the COVID-19 and HPV Vaccines

Maxwell Weinzierl, Sanda M. Harabagiu|arXiv (Cornell University)|Feb 18, 2022
Misinformation and Its Impacts被引用 6
一句话总结

本文介绍了VaccineLies,这是一个大规模的自然语言资源,包含推文、针对COVID-19和HPV疫苗的虚假信息目标(MisTs)以及立场标注,旨在支持社交媒体上虚假信息检测与立场识别的监督学习。通过在跨疫苗迁移学习中进行预训练和微调,该研究在HPV立场检测上实现了94.5的SOTA F1分数,在COVID-19立场检测上实现了84.0的SOTA F1分数。

ABSTRACT

Billions of COVID-19 vaccines have been administered, but many remain hesitant. Misinformation about the COVID-19 vaccines and other vaccines, propagating on social media, is believed to drive hesitancy towards vaccination. The ability to automatically recognize misinformation targeting vaccines on Twitter depends on the availability of data resources. In this paper we present VaccineLies, a large collection of tweets propagating misinformation about two vaccines: the COVID-19 vaccines and the Human Papillomavirus (HPV) vaccines. Misinformation targets are organized in vaccine-specific taxonomies, which reveal the misinformation themes and concerns. The ontological commitments of the Misinformation taxonomies provide an understanding of which misinformation themes and concerns dominate the discourse about the two vaccines covered in VaccineLies. The organization into training, testing and development sets of VaccineLies invites the development of novel supervised methods for detecting misinformation on Twitter and identifying the stance towards it. Furthermore, VaccineLies can be a stepping stone for the development of datasets focusing on misinformation targeting additional vaccines.

研究动机与目标

  • 为解决社交媒体上针对COVID-19和HPV疫苗的虚假信息标注数据集缺乏的问题。
  • 构建一个结构化的虚假信息目标(MisTs)分类体系,以捕捉疫苗相关话语中的重复主题与关切。
  • 收集并标注大规模推文数据集,这些推文引发了至少一个MisT,并为每个推文明确标注立场(接受、拒绝、无立场)。
  • 通过提供跨疫苗虚假信息检测与立场识别的训练、开发和测试划分,支持跨疫苗的迁移学习。
  • 通过支持NLP模型大规模识别并应对虚假信息,助力公共卫生干预。

提出的方法

  • 采用双重方法识别MisTs:从维基百科挖掘广泛讨论的误解,并分析病毒式传播的推特对话。
  • 构建针对特定疫苗的MisTs分类体系,按主题与关切(如DNA改变、疫苗禁令等)对虚假信息进行分类。
  • 收集并整理每个疫苗超过1,000条推文ID,这些推文引发了至少一个MisT,并由语言专家验证。
  • 使用经专家验证的标注方法,为每条推文标注其对所引发MisT的立场(接受、拒绝、无立场)。
  • 在四种迁移学习场景下训练并评估基于BERT的模型(BERT-VMED与BERT-VMSI):经典训练、零样本学习、联合训练以及预训练/微调。
  • 通过在CoVaxLies(COVID-19)和HpVaxLies(HPV)的独立测试集上评估精确率、召回率与F1分数,衡量性能。

实验结果

研究问题

  • RQ1在推特上,针对COVID-19和HPV疫苗的虚假信息中,主导的主题与关切是什么?
  • RQ2当新疫苗缺乏训练数据时,迁移学习在检测疫苗虚假信息方面的有效性如何?
  • RQ3在一种疫苗上训练的立场检测模型能否泛化到另一种疫苗?不同迁移学习场景下的性能表现如何?
  • RQ4基于BERT的模型在使用VaccineLies数据集识别虚假信息引发与作者立场方面的表现如何?
  • RQ5不同的训练策略(如预训练、微调、联合训练)如何影响虚假信息检测与立场分类的性能?

主要发现

  • 在Pre-Train场景下,HPV疫苗数据集(HpVaxLies)的虚假信息立场识别F1分数达到最高,为94.5,优于其他迁移学习策略。
  • 在虚假信息检测方面,Pre-Train方法在CoVaxLies上达到91.7的F1分数,在HpVaxLies上达到94.5的F1分数,显示出强大的跨疫苗泛化能力。
  • Zero-Shot迁移学习场景也取得了具有竞争力的结果,立场识别的F1分数分别为73.5(CoVaxLies)和74.6(HpVaxLies),表明无需目标领域数据即可实现可行性。
  • 在两种疫苗上联合训练提升了HpVaxLies的表现,但未提升CoVaxLies的表现,表明不同疫苗间虚假信息模式存在不对称性。
  • 在Pre-Train场景下,BERT-VMSI模型在CoVaxLies上的宏平均F1得分为84.0,在HpVaxLies上为83.6,表明其在立场检测方面表现优异。
  • 该数据集的分类体系揭示了不同的虚假信息主题:对于COVID-19,mRNA改变DNA的担忧较为普遍;对于HPV,关于禁令和企业动机的阴谋论更为常见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。