[论文解读] NoFake at CheckThat! 2021: Fake News Detection Using BERT
本文提出了一种基于 BERT 的假新闻检测与领域分类模型,通过利用额外的经过验证的数据提升性能。在 CheckThat! 2021 评估中,该模型在任务 3A 上取得了 83.76% 的宏 F1 分数,在任务 3B 上取得了 85.55% 的宏 F1 分数,通过标签合并与领域感知分类实现了更好的泛化能力。
Much research has been done for debunking and analysing fake news. Many researchers study fake news detection in the last year, but many are limited to social media data. Currently, multiples fact-checkers are publishing their results in various formats. Also, multiple fact-checkers use different labels for the fake news, making it difficult to make a generalisable classifier. With the merge classes, the performance of the machine model can be enhanced. This domain categorisation will help group the article, which will help save the manual effort in assigning the claim verification. In this paper, we have presented BERT based classification model to predict the domain and classification. We have also used additional data from fact-checked articles. We have achieved a macro F1 score of 83.76 % for Task 3Aand 85.55 % for Task 3B using the additional training data.
研究动机与目标
- 开发一个统一的基于 BERT 的模型,用于同时执行假新闻检测与文章领域分类。
- 通过合并多个事实核查来源中的相似假新闻标签,提升模型的泛化能力。
- 通过自动化的文章按领域分类,减少人工在事实核查中的工作量。
- 通过引入来自经过验证文章的额外训练数据,提升模型性能。
- 通过构建统一的分类框架,解决事实核查平台之间标签不一致的问题。
提出的方法
- 在经过标签合并的多标签假新闻数据集上微调预训练的 BERT 模型,以提升泛化能力。
- 引入来自经过验证文章的额外训练数据,以增强模型的鲁棒性。
- 训练一个联合分类头,同时预测假新闻状态与文章领域。
- 应用标签合并策略,以减少类别不平衡问题,并提升在多样化事实核查来源上的模型性能。
- 将宏 F1 分数作为二元假新闻检测与多类别领域分类任务的主要评估指标。
- 利用 BERT 的迁移学习能力,有效捕捉新闻文本中的上下文与语义特征。
实验结果
研究问题
- RQ1统一的基于 BERT 的模型能否有效同时执行假新闻检测与领域分类?
- RQ2从多个事实核查来源合并标签对模型性能与泛化能力有何影响?
- RQ3引入额外的经过验证数据在多大程度上提升了检测准确率?
- RQ4领域分类能否减少事实核查流程中的人工工作量?
- RQ5该模型在 CheckThat! 2021 任务 3A 与 3B 等标准化基准上的表现如何?
主要发现
- 该模型在任务 3A(聚焦于假新闻检测)上取得了 83.76% 的宏 F1 分数。
- 该模型在任务 3B(包含假新闻检测与领域分类)上取得了 85.55% 的宏 F1 分数。
- 整合额外的经过验证数据显著提升了模型在两项任务上的表现。
- 在事实核查来源之间进行标签合并,有助于提升模型的泛化能力并减少类别不平衡。
- 联合预测假新闻状态与领域类别,使得事实核查工作流更加高效与可扩展。
- 结果表明,具备领域感知能力的分类可显著提升假新闻检测系统的整体有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。