QUICK REVIEW
[论文解读] COVID-Twitter-BERT: A Natural Language Processing Model to Analyse COVID-19 Content on Twitter
Martín Müller, Marcel Salathé|arXiv (Cornell University)|May 15, 2020
Misinformation and Its Impacts被引用 135
一句话总结
{
ABSTRACT
In this work, we release COVID-Twitter-BERT (CT-BERT), a transformer-based model, pretrained on a large corpus of Twitter messages on the topic of COVID-19. Our model shows a 10-30% marginal improvement compared to its base model, BERT-Large, on five different classification datasets. The largest improvements are on the target domain. Pretrained transformer models, such as CT-BERT, are trained on a specific target domain and can be used for a wide variety of natural language processing tasks, including classification, question-answering and chatbots. CT-BERT is optimised to be used on COVID-19 content, in particular social media posts from Twitter.
研究动机与目标
- 推动对社交媒体上 COVID-19 内容的改进自然语言处理分析。
- 通过在 COVID-19 推特数据上进行预训练来开发一个领域特定的变换模型。
- 在多个基于 Twitter 的任务上评估 CT-BERT 相对于通用领域模型的表现。
提出的方法
- 使用通过 Crowdbreaks 收集的 1.6 亿条 COVID-19 推文对 BERT-Large 模型进行预训练。
- 通过移除转发、重复项以及将用户名和 URL 伪匿名化来清洗数据。
- 使用 30,000 词汇表对推文进行分词,序列长度上限设为 96。
- 使用恒定学习率 2e-5 进行训练,并使用 10 倍重复因子来创建 285M 个训练样本。
- 在五个下游分类数据集上对 CT-BERT 与 BERT-Large 进行多次微调评估。
- 通过 GitHub 提供代码和模型访问以实现可重复性。
实验结果
研究问题
- RQ1在 COVID-19 推特数据上进行域特定预训练,是否相对于通用领域模型提高了下游分类性能?
- RQ2相对于非 COVID 推特任务,COVID-19 相关任务的增益有多大?
- RQ3预训练步骤与跨任务下游性能之间存在哪种关系?
主要发现
- CT-BERT 将五个数据集的平均 F1 从 0.802(BERT-Large)提升至 0.833。
- 相对改进最大(ΔMP)发生在 COVID-19 Category 数据集,达到 25.88%。
- 疫苗情感(MVS)显示 17.07% 的 ΔMP,SST-2 10.67%,SE 8.97%,平均 ΔMP 为 17.57%。
- CT-BERT 在健康相关的 COVID-19 内容上取得最强增益,特别是在 COVID-19 和疫苗相关的 Twitter 数据上。
- 中间预训练检查点显示大多数下游增益在 100–200k 步骤时就已出现,此后收益递减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。