[论文解读] RobBERT-2022: Updating a Dutch Language Model to Account for Evolving Language Use
该论文提出了 RobBERT-2022,即基于 RoBERTa 的最新荷兰语语言模型的更新版本,通过在 2022 年荷兰语 OSCAR 语料库中扩展分词器以引入新的高频词素,并在此数据上进一步预训练。更新后的模型在近期荷兰语 NLP 任务中实现了显著的性能提升,尤其在与新冠疫情相关的文本处理中表现突出,同时在旧基准测试中仍保持强劲性能,证明了持续对语言模型进行适应以应对语言演变的必要性。
Large transformer-based language models, e.g. BERT and GPT-3, outperform previous architectures on most natural language processing tasks. Such language models are first pre-trained on gigantic corpora of text and later used as base-model for finetuning on a particular task. Since the pre-training step is usually not repeated, base models are not up-to-date with the latest information. In this paper, we update RobBERT, a RoBERTa-based state-of-the-art Dutch language model, which was trained in 2019. First, the tokenizer of RobBERT is updated to include new high-frequent tokens present in the latest Dutch OSCAR corpus, e.g. corona-related words. Then we further pre-train the RobBERT model using this dataset. To evaluate if our new model is a plug-in replacement for RobBERT, we introduce two additional criteria based on concept drift of existing tokens and alignment for novel tokens.We found that for certain language tasks this update results in a significant performance increase. These results highlight the benefit of continually updating a language model to account for evolving language use.
研究动机与目标
- 为解决语言模型因语言使用不断演变而过时的问题,特别是针对荷兰语。
- 更新于 2019 年训练的先进荷兰语 BERT 模型 RobBERT,以反映近期的语言变化。
- 评估更新后的模型在旧任务上是否保持性能,同时在新近任务上实现提升。
- 引入基于概念漂移和新词素对齐的新评估标准。
提出的方法
- 扩展 RoBERTa 分词器,纳入来自 2022 年荷兰语 OSCAR 语料库的新高频子词和词素,例如与新冠相关的术语。
- 使用掩码语言建模(MLM)作为唯一预训练目标,在 2022 年 OSCAR 数据集上对 RobBERT v2 模型进行进一步预训练。
- 使用 AdamW 优化器,初始基础学习率为 1e-6,设置 1,000 个学习率热身步数,并基于验证困惑度(PPPL)实施早停策略。
- 通过基准任务、近期特定领域任务(如新冠疫情 FAQ 分类和推文分类)以及句向量的 t-SNE 可视化,对模型进行评估。
- 引入两项新评估标准:对已有词素的概念漂移分析,以及对新词素的对齐度评估。
实验结果
研究问题
- RQ1在更近期的荷兰语文本语料库上进行进一步预训练,是否能在不降低旧基准测试性能的前提下,提升在近期 NLP 任务上的表现?
- RQ2更新后的模型在先前学习到的语言模式上,表现出多大程度的概念漂移或灾难性遗忘?
- RQ3RobBERT-2022 的词向量在捕捉新引入词素(如与新冠疫情相关的术语)的语义信息方面表现如何?
- RQ4更新后的模型能否作为原始 RobBERT 在下游应用中的直接插件替代品?
主要发现
- 在分类荷兰语新冠疫情疫苗 FAQ 的 VaccinChat 任务中,RobBERT-2022 达到了 79.3% 的 F1 分数,优于原始 RobBERT v2 的 77.2% F1 分数。
- 在关于比利时新冠疫情措施的推文分类任务中,RobBERT-2022 达到了 75% 的准确率,而原始 RobBERT 和多语言 BERT 均为 73%。
- 模型表现出极小的概念漂移,旧基准任务性能无显著下降,且在原始 2019 年语料库上的伪困惑度仅略有上升(9.40 vs. 7.76)。
- t-SNE 可视化显示,RobBERT-2022 与原始模型的句向量分布存在明显偏移,表明其已适应 2022 年数据中的新语义模式。
- 更新后的模型在保持强大泛化能力的同时,对近期语言使用(尤其是与疫情相关的术语)表现出更优的语义对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。