Skip to main content
QUICK REVIEW

[论文解读] Czert -- Czech BERT-like Model for Language Representation

Jakub Sido, Ondřej Pražák|arXiv (Cornell University)|Mar 24, 2021
Natural Language Processing Techniques参考文献 38被引用 7
一句话总结

本文介绍了Czert,这是首个基于BERT和ALBERT架构的捷克语单语Bert类语言模型,其在36 GB多样化捷克语文本(比多语言模型多50倍的句子)上进行预训练。Czert-B模型在11项NLP任务中的9项上达到最先进性能,优于mBERT和SlavicBERT等多语言模型,在语义相似性、情感分类、命名实体识别和语义角色标注任务中表现更优,并为研究用途公开发布了预训练和微调模型。

ABSTRACT

This paper describes the training process of the first Czech monolingual language representation models based on BERT and ALBERT architectures. We pre-train our models on more than 340K of sentences, which is 50 times more than multilingual models that include Czech data. We outperform the multilingual models on 9 out of 11 datasets. In addition, we establish the new state-of-the-art results on nine datasets. At the end, we discuss properties of monolingual and multilingual models based upon our results. We publish all the pre-trained and fine-tuned models freely for the research community.

研究动机与目标

  • 开发高性能的、专为捷克语设计的单语BERT类语言模型,以克服多语言模型的局限性。
  • 在比多语言模型中可用的更大规模的捷克语特有语料(36 GB,超过34万句子)上预训练模型,以增强语言表征能力。
  • 在关键捷克语NLP任务(包括语义文本相似性、命名实体识别和情感分类)上建立最先进结果。
  • 向捷克语NLP社区公开完全训练好的、可直接使用的预训练和微调模型。

提出的方法

  • 从随机初始化开始,基于包含维基百科、新闻和捷克国家语料库的36 GB捷克语文本语料,对Czert-B(基于BERT)和Czert-A(基于ALBERT)模型进行预训练。
  • 使用标准的掩码语言建模(MLM)目标和修改后的下一句预测(NSP)任务作为预训练目标。
  • 在六个下游NLP任务上微调预训练模型:语义文本相似性(STS)、命名实体识别(NER)、词形标注(MoT)、语义角色标注(SRL)、情感分类(SC)和多标签文档分类(MLC)。
  • 在这些任务的11个数据集上评估性能,并与多语言模型(mBERT和SlavicBERT)进行比较。
  • 采用标准的BERT/ALBERT架构,包含12层、768个隐藏维度(Czert-B)和12个注意力头,Czert-A中通过参数共享减少参数量。
  • 在STS任务上使用10折交叉验证,并报告平均性能及95%置信区间。

实验结果

研究问题

  • RQ1在大规模、多样化的捷克语文本语料上预训练的单语BERT类模型,是否能在捷克语NLP任务上超越现有多语言模型?
  • RQ2捷克语专用模型在各种NLP基准测试中,与mBERT和SlavicBERT等多语言模型相比表现如何?
  • RQ3将预训练语料规模扩大50倍,对捷克语NLP下游任务性能的提升程度如何?
  • RQ4Czert-B模型是否在语义文本相似性和命名实体识别等关键捷克语NLP任务上达到最先进性能?

主要发现

  • Czert-B在11个评估数据集中的9个上优于mBERT和SlavicBERT,在9个数据集上建立了新的最先进结果。
  • 在STS任务上,Czert-B的皮尔逊相关系数达到89.29±0.17,显著优于mBERT(87.88±0.08)和SlavicBERT(88.97±0.09)。
  • 在情感分类(SC)任务上,Czert-B的F1值达到83.74±0.40,较CNA数据集上先前的最先进结果提升5%。
  • 在CNEC数据集上的NER任务中,Czert-B的F1得分为86.27,较先前最先进结果提升5%,并超过SlavicBERT。
  • 在CoNLL-09 SRL数据集上,Czert-B实现了新的最先进F1值99.410,优于mBERT(99.301)和SlavicBERT(99.211)。
  • 与多语言基线相比,这些模型表现出更稳定、更鲁棒的训练过程,尤其在小样本数据集上过拟合现象更少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。