[论文解读] Overview of the CLEF-2021 CheckThat! Lab Task 2 on detecting previously fact-checked claims in tweets and political debates
本论文介绍了2021年 CLEF-2021 CheckThat! 实验,该实验是一项多语言事实核查评估,包含三个任务:识别推文中的值得核查的声明(任务1)、检索以往已核查的声明以支持验证(任务2),以及检测虚假新闻并分类新闻文章的主题领域(任务3)。研究展示了基于变换器模型的优异性能,最佳系统在声明核查任务中达到0.881的宏平均F1值,在主题分类任务中达到0.905的准确率。
We describe the fourth edition of the CheckThat! Lab, part of the 2021 Conference and Labs of the Evaluation Forum (CLEF). The lab evaluates technology supporting three tasks related to factuality, and it covers Arabic, Bulgarian, English, Spanish, and Turkish. Here, we present the task 2, which asks to detect previously fact-checked claims (in two languages). A total of four teams participated in this task, submitted a total of sixteen runs, and most submissions managed to achieve sizable improvements over the baselines using transformer based models such as BERT, RoBERTa. In this paper, we describe the process of data collection and the task setup, including the evaluation measures used, and we give a brief overview of the participating systems. Last but not least, we release to the research community all datasets from the lab as well as the evaluation scripts, which should enable further research in detecting previously fact-checked claims.
研究动机与目标
- 开发并评估自动化系统,以在多语言社交媒体和政治话语中检测值得核查的声明。
- 通过检索以往已核查的声明,防止重复的事实核查工作。
- 对新闻文章的真伪和主题领域进行分类,以支持专家路由和自动化核查。
- 通过纳入阿拉伯语、保加利亚语、英语、西班牙语和土耳其语,推动多语言事实核查技术的发展。
- 通过核查价值估计、声明检索和虚假新闻检测的流水线,支持人工事实核查员的工作。
提出的方法
- 任务1使用排名模型,基于 BERT、RoBERTa 和 AraBERT 对多语言输入进行建模,预测关于新冠疫情和政治话题的推文的核查价值。
- 任务2采用微调的变换器模型(如 RoBERTa)根据语义相似度对目标声明进行检索,以匹配以往已核查的声明。
- 任务3应用多分类任务,采用变换器架构(如 BERT、集成模型)预测新闻文章的真伪和主题领域。
- 评估指标包括排名任务的平均平均精度(MAP)和分类任务的宏平均F1值。
- 系统流水线整合了声明检测、证据检索和真伪预测,以支持半自动的事实核查工作流。
- 数据集来源于真实世界来源:推特流、政治辩论和五种语言的新闻文章。
实验结果
研究问题
- RQ1基于变换器的模型在多语言社交媒体内容中识别值得核查声明的效率如何?
- RQ2在声明核查中,能否通过语义匹配有效检索以往已核查的声明?
- RQ3多分类虚假新闻检测模型能否准确预测新闻文章的真伪和主题领域?
- RQ4在事实核查任务中,性能在阿拉伯语、英语、保加利亚语、西班牙语和土耳其语之间的差异如何?
- RQ5集成模型和微调的变换器对声明核查和主题分类准确率的影响如何?
主要发现
- 任务2(以往已核查声明检索)中表现最佳的系统使用三种变换器模型的集成,达到0.881的宏平均F1值。
- 在任务3B(主题领域分类)中,排名第一的团队(NITK_NLP)达到0.881的宏平均F1值和0.905的准确率,各类别F1值均较高(如气候类为0.950,健康类为0.946)。
- 任务3B中第二名系统(NoFake)达到0.855的宏平均F1值,表明在包括犯罪(0.875)和教育(0.957)等多样化领域中表现稳健。
- 任务1中,BERT 和 RoBERTa 模型表现优异,尤其在英语和阿拉伯语中,表现最佳的系统使用了 AraBERT 和多语言 BERT。
- 任务3A(虚假新闻检测)整体性能较低,最佳系统达到0.841的宏平均F1值,表明在区分虚假与真实新闻方面仍具挑战。
- 该实验吸引了132支注册团队,任务1、2和3分别有15、5和25支官方提交,使其成为 CLEF-2021 中最受欢迎的实验。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。