[论文解读] QMUL-SDS at CheckThat! 2020: Determining COVID-19 Tweet Check-Worthiness Using an Enhanced CT-BERT with Numeric Expressions
本论文提出了一种基于CNN的模型,结合COVID-Twitter-BERT(CT-BERT)与数值表达式的专用分词方法,以提升对COVID-19推文的核查价值检测性能。最佳系统在CLEF 2020 CheckThat!共享任务中获得第4名,表明将数值表达式视为特殊标记可显著提升性能,而使用PHEME数据集中的谣言数据进行数据增强虽未带来整体F1值提升,但增强了模型的泛化能力。
This paper describes the participation of the QMUL-SDS team for Task 1 of the CLEF 2020 CheckThat! shared task. The purpose of this task is to determine the check-worthiness of tweets about COVID-19 to identify and prioritise tweets that need fact-checking. The overarching aim is to further support ongoing efforts to protect the public from fake news and help people find reliable information. We describe and analyse the results of our submissions. We show that a CNN using COVID-Twitter-BERT (CT-BERT) enhanced with numeric expressions can effectively boost performance from baseline results. We also show results of training data augmentation with rumours on other topics. Our best system ranked fourth in the task with encouraging outcomes showing potential for improved results in the future.
研究动机与目标
- 开发一种能够识别并优先处理需要事实核查的COVID-19推文的系统,以应对虚假信息传播。
- 通过引入数值表达式处理能力的BERT嵌入,提升基于BERT的核查价值检测性能。
- 评估使用外部谣言数据集进行数据增强对模型泛化能力与性能的影响。
- 分析不同预处理策略(尤其是数值表达式分词)对模型鲁棒性的影响。
- 探究利用相关任务(如谣言检测)是否能提升核查价值分类的性能。
提出的方法
- 模型使用微调后的COVID-Twitter-BERT(CT-BERT)对推文进行上下文表征。
- 将数值表达式替换为特殊标记<number>,以提升模型泛化能力并捕捉与声明相关的模式。
- 使用一维卷积神经网络(1D CNN)处理上下文嵌入,将推文分类为具有核查价值或无核查价值。
- 训练了三种模型变体:一种采用完整分词,一种仅对数值表达式进行分词,一种使用PHEME谣言数据集的外部数据进行训练数据增强。
- 利用PHEME的外部数据对训练集进行增强,旨在提升模型对未见主题的泛化能力。
- 模型选择基于开发集上的表现,表现最佳的三个模型被提交至官方测试集。
实验结果
研究问题
- RQ1将数值表达式作为特殊标记处理是否能提升基于BERT的模型在检测具有核查价值的COVID-19推文方面的性能?
- RQ2使用来自不同领域的外部谣言数据集进行数据增强,能否提升核查价值检测模型的泛化能力?
- RQ3预处理策略的选择(尤其是数值表达式分词)如何影响模型在未见测试数据上的性能与泛化能力?
- RQ4在低资源环境下,不同BERT嵌入与模型架构在多大程度上有助于提升核查价值检测性能?
- RQ5在核查价值分类系统中引入来自相关但不同任务(如谣言检测)的数据时,领域分布偏移会产生何种影响?
主要发现
- 表现最佳的模型采用CT-BERT并仅对数值表达式进行<number>标记,其平均平均精度(MAP)达到0.78,在CLEF 2020共享任务中排名第四。
- 模型1采用包括标点符号在内的广泛分词,MAP为0.71,表明最小化预处理可保留更多可泛化的模式。
- 模型3通过PHEME数据集的谣言数据增强训练集,在测试集上表现优于基线模型,尽管其在开发集上的表现较低,表明泛化能力得到提升。
- 使用数值表达式分词显著提升了模型性能,所有最佳模型在k=1、3、5和10时的精确率均达到1.00。
- 使用PHEME数据进行数据增强提升了R-precision(从0.63提升至0.70)与precision@50(从0.64提升至0.68),表明长尾性能更优。
- 尽管在特定指标上有所提升,但将PHEME数据与原始训练集结合后,整体F1或MAP未见显著提升,表明领域与任务不匹配限制了迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。