Skip to main content
QUICK REVIEW

[论文解读] Model Generalization on COVID-19 Fake News Detection

Yejin Bang, Etsuko Ishii|arXiv (Cornell University)|Jan 11, 2021
Misinformation and Its Impacts参考文献 38被引用 6
一句话总结

本文提出两种方法以提升COVID-19虚假新闻检测中模型的泛化能力:使用鲁棒损失函数微调基于BERT的模型,以及通过影响函数进行数据清洗以移除有害训练样本。表现最佳的模型在保留的测试集(Tweets-19)上取得了54.33%的加权F1分数,显著优于基线模型,表明数据清洗可在不牺牲原始任务性能的前提下提升泛化能力。

ABSTRACT

Amid the pandemic COVID-19, the world is facing unprecedented infodemic with the proliferation of both fake and real information. Considering the problematic consequences that the COVID-19 fake-news have brought, the scientific community has put effort to tackle it. To contribute to this fight against the infodemic, we aim to achieve a robust model for the COVID-19 fake-news detection task proposed at CONSTRAINT 2021 (FakeNews-19) by taking two separate approaches: 1) fine-tuning transformers based language models with robust loss functions and 2) removing harmful training instances through influence calculation. We further evaluate the robustness of our models by evaluating on different COVID-19 misinformation test set (Tweets-19) to understand model generalization ability. With the first approach, we achieve 98.13% for weighted F1 score (W-F1) for the shared task, whereas 38.18% W-F1 on the Tweets-19 highest. On the contrary, by performing influence data cleansing, our model with 99% cleansing percentage can achieve 54.33% W-F1 score on Tweets-19 with a trade-off. By evaluating our models on two COVID-19 fake-news test sets, we suggest the importance of model generalization ability in this task to step forward to tackle the COVID-19 fake-news problem in online social media platforms.

研究动机与目标

  • 开发一种鲁棒的模型,用于在COVID-19信息疫情背景下检测虚假新闻。
  • 通过在独立测试集(Tweets-19)上进行评估,提升模型在共享任务基准之外的泛化能力。
  • 探究鲁棒损失函数与基于影响函数的数据清洗是否能提升模型性能与泛化能力。
  • 评估模型在原始任务性能与对域外数据泛化能力之间的权衡。
  • 为低资源、高风险的NLP任务(如虚假信息检测)提供构建更具泛化能力模型的框架。

提出的方法

  • 使用对称交叉熵和广义交叉熵等鲁棒损失函数微调RoBERTa-large模型,以提升对噪声或误标训练样本的鲁棒性。
  • 应用影响函数分析识别并移除对模型预测影响最大的有害训练样本。
  • 在不同比例(从5%到99%)下执行数据清洗,以评估其对模型泛化能力与性能的影响。
  • 在两个独立的测试集上评估模型:CONSTRAINT 2021共享任务数据集(FakeNews-19)和一个独立测试集(Tweets-19),以评估泛化能力。
  • 使用二分类F1、精确率和召回率分数分析不同清洗比例下的类别性能及权衡。
  • 比较不同损失函数与清洗水平下的模型性能,以分离每种技术对泛化能力的影响。

实验结果

研究问题

  • RQ1鲁棒损失函数是否能提升模型在域外虚假新闻检测基准上的泛化能力?
  • RQ2基于影响函数的数据清洗在保持原始任务性能的同时,能在多大程度上提升模型在未见测试集上的性能?
  • RQ3在不同评估集上,数据清洗比例与模型性能之间的最优权衡是什么?
  • RQ4不同损失函数与数据清洗策略如何影响虚假新闻检测中的类别精确率与召回率?
  • RQ5在某一虚假新闻数据集上训练的模型,能否有效泛化到同一领域但不同的测试集?

主要发现

  • 使用鲁棒损失函数(课程损失)微调的模型在FakeNews-19共享任务上取得了98.13%的加权F1分数,表明其在原始基准上的强大性能。
  • 在域外的Tweets-19测试集上,同一模型仅取得38.18%的加权F1分数,表明仅依赖鲁棒损失函数时泛化能力较差。
  • 基于影响函数的数据清洗显著提升了泛化能力:99%的清洗率在Tweets-19上达到54.33%的加权F1分数,较基线模型提升16.15%。
  • 该模型在Tweets-19上实现了61.10%的准确率,表明其在具有挑战性的域外测试集上表现强劲。
  • 随着清洗比例的提高,模型对真实新闻的召回率提升至71.50%,而虚假新闻的精确率提升至37.17%,表明其对真实内容的检测能力增强。
  • 在Tweets-19数据集上,基于影响函数的清洗方法相比基线模型,虚假标签F1提升8.37%,真实标签F1提升38.17%,证实其在提升泛化能力方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。