Skip to main content
QUICK REVIEW

[论文解读] COVID-Twitter-BERT: A Natural Language Processing Model to Analyse COVID-19 Content on Twitter

Martín Müller, Marcel Salathé|arXiv (Cornell University)|May 15, 2020
Misinformation and Its Impacts被引用 135
一句话总结

{

ABSTRACT

In this work, we release COVID-Twitter-BERT (CT-BERT), a transformer-based model, pretrained on a large corpus of Twitter messages on the topic of COVID-19. Our model shows a 10-30% marginal improvement compared to its base model, BERT-Large, on five different classification datasets. The largest improvements are on the target domain. Pretrained transformer models, such as CT-BERT, are trained on a specific target domain and can be used for a wide variety of natural language processing tasks, including classification, question-answering and chatbots. CT-BERT is optimised to be used on COVID-19 content, in particular social media posts from Twitter.

研究动机与目标

  • 推动对社交媒体上 COVID-19 内容的改进自然语言处理分析。
  • 通过在 COVID-19 推特数据上进行预训练来开发一个领域特定的变换模型。
  • 在多个基于 Twitter 的任务上评估 CT-BERT 相对于通用领域模型的表现。

提出的方法

  • 使用通过 Crowdbreaks 收集的 1.6 亿条 COVID-19 推文对 BERT-Large 模型进行预训练。
  • 通过移除转发、重复项以及将用户名和 URL 伪匿名化来清洗数据。
  • 使用 30,000 词汇表对推文进行分词,序列长度上限设为 96。
  • 使用恒定学习率 2e-5 进行训练,并使用 10 倍重复因子来创建 285M 个训练样本。
  • 在五个下游分类数据集上对 CT-BERT 与 BERT-Large 进行多次微调评估。
  • 通过 GitHub 提供代码和模型访问以实现可重复性。

实验结果

研究问题

  • RQ1在 COVID-19 推特数据上进行域特定预训练,是否相对于通用领域模型提高了下游分类性能?
  • RQ2相对于非 COVID 推特任务,COVID-19 相关任务的增益有多大?
  • RQ3预训练步骤与跨任务下游性能之间存在哪种关系?

主要发现

  • CT-BERT 将五个数据集的平均 F1 从 0.802(BERT-Large)提升至 0.833。
  • 相对改进最大(ΔMP)发生在 COVID-19 Category 数据集,达到 25.88%。
  • 疫苗情感(MVS)显示 17.07% 的 ΔMP,SST-2 10.67%,SE 8.97%,平均 ΔMP 为 17.57%。
  • CT-BERT 在健康相关的 COVID-19 内容上取得最强增益,特别是在 COVID-19 和疫苗相关的 Twitter 数据上。
  • 中间预训练检查点显示大多数下游增益在 100–200k 步骤时就已出现,此后收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。