Skip to main content
QUICK REVIEW

[论文解读] German's Next Language Model

Branden Chan, Stefan Schweter|arXiv (Cornell University)|Oct 21, 2020
Topic Modeling参考文献 22被引用 9
一句话总结

本文提出了GBERT和GELECTRA,即采用评估驱动方法训练的最先进的德语BERT和ELECTRA语言模型,该方法在预训练过程中通过定期下游评估选择表现最佳的检查点。这些模型在GermEval18和GermEval14上取得了新的SOTA结果,其中GELECTRA Large在命名实体识别(NER)上提升了+4.3%的F1值,在仇恨言论检测上提升了+2.45%,同时表明增加训练数据量和使用全词遮蔽(Whole Word Masking)可显著提升性能。

ABSTRACT

In this work we present the experiments which lead to the creation of our BERT and ELECTRA based German language models, GBERT and GELECTRA. By varying the input training data, model size, and the presence of Whole Word Masking (WWM) we were able to attain SoTA performance across a set of document classification and named entity recognition (NER) tasks for both models of base and large size. We adopt an evaluation driven approach in training these models and our results indicate that both adding more data and utilizing WWM improve model performance. By benchmarking against existing German models, we show that these models are the best German models to date. Our trained models will be made publicly available to the research community.

研究动机与目标

  • 通过基于下游任务性能选择最优检查点的评估驱动预训练策略,开发高性能的德语语言模型。
  • 研究训练数据量、模型规模和全词遮蔽(WWM)对德语BERT和ELECTRA模型性能的影响。
  • 在德语NLP基准测试(包括文档分类和命名实体识别(NER))上建立新的SOTA性能。
  • 向研究社区公开高质量、可访问的德语语言模型。

提出的方法

  • 采用评估驱动的预训练方法,定期对模型进行检查点保存,并在下游分类和NER任务上进行评估,以选择表现最佳的模型。
  • 通过改变输入数据(如OSCAR、Common Crawl)、模型规模(base和large)以及是否启用全词遮蔽(WWM)来测试多种训练方案。
  • 对于基于BERT的模型,采用掩码语言建模(MLM)方法,WWM确保一个词的所有子词标记被一同遮蔽。
  • 对于基于ELECTRA的模型,采用替换标记检测的预训练任务,其中生成器生成合理的标记替代品,判别器则分类每个标记是真实还是被替换的。
  • 在下游任务(如GermEval18(仇恨言论检测)和GermEval14(NER))上对模型进行微调,性能通过F1值和准确率衡量。
  • 训练使用TPU集群和EC2实例进行,模型选择基于在所有评估任务中表现最高的性能。

实验结果

研究问题

  • RQ1增加训练数据量是否显著提升德语BERT和ELECTRA模型的性能?
  • RQ2与标准遮蔽相比,全词遮蔽(WWM)对德语BERT模型性能有何影响?
  • RQ3由于预训练效率更高,ELECTRA-based模型是否能在更少训练标记数下实现优于BERT-based模型的性能?
  • RQ4模型规模(base与large)如何影响德语NLP任务的下游性能?
  • RQ5评估驱动的预训练策略是否在最终模型性能上优于标准的固定步长训练?

主要发现

  • GELECTRA Large在GermEval14 NER任务上取得了88.95的新SOTA F1分数,比之前最佳结果高出+4.3%。
  • 在GermEval18仇恨言论检测任务中,GELECTRA Large在细粒度变体上比之前SOTA高出+2.45%,在粗粒度变体上高出+3.93%。
  • GBERT Data + WWM在三个NLP任务上的平均F1值比DBMDZ BERT Base高出+2.18%。
  • 尽管训练所用参数量仅为一半(因小批量训练),GELECTRA Large在平均F1上仍比GBERT Large高出+1.47%。
  • 全词遮蔽一致提升了基于BERT的模型性能,其中GBERT WWM比DBMDZ BERT Base高出+1.25% F1,GBERT Data + WWM比GBERT Data高出+2.38% F1。
  • 增加更多训练数据带来了可测量的性能增益,其中GELECTRA Data比GELECTRA高出+1.59% F1,GBERT Data + WWM比GBERT Data高出+0.93% F1。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。