Skip to main content
QUICK REVIEW

[论文解读] Bertinho: Galician BERT Representations

David Vilares, Marcos García|arXiv (Cornell University)|Mar 25, 2021
Basque language and culture studies参考文献 49被引用 10
一句话总结

本文介绍了 Bertinho,一个在单GPU上使用少于4500万词的加利西亚语语料微调的单语BERT模型。尽管数据有限,12层的Bertinho base模型在词性标注、依存句法分析和命名实体识别任务中均优于多语言BERT(mBERT),6层变体在大多数任务中也优于mBERT。

ABSTRACT

This paper presents a monolingual BERT model for Galician. We follow the recent trend that shows that it is feasible to build robust monolingual BERT models even for relatively low-resource languages, while performing better than the well-known official multilingual BERT (mBERT). More particularly, we release two monolingual Galician BERT models, built using 6 and 12 transformer layers, respectively; trained with limited resources (~45 million tokens on a single GPU of 24GB). We then provide an exhaustive evaluation on a number of tasks such as POS-tagging, dependency parsing and named entity recognition. For this purpose, all these tasks are cast in a pure sequence labeling setup in order to run BERT without the need to include any additional layers on top of it (we only use an output classification layer to map the contextualized representations into the predicted label). The experiments show that our models, especially the 12-layer one, outperform the results of mBERT in most tasks.

研究动机与目标

  • 开发用于加利西亚语的单语BERT模型,以解决该低资源语言缺乏上下文嵌入表示的问题。
  • 评估在数据受限条件下模型深度(6层与12层)对性能的影响。
  • 在下游NLP任务中,将单语加利西亚语BERT(Bertinho)与多语言BERT(mBERT)进行比较。
  • 研究两阶段预训练策略在低资源语言建模中的有效性。
  • 向NLP社区免费发布高性能、可用的加利西亚语BERT模型。

提出的方法

  • 在单语加利西亚语语料(少于4500万词)上预训练了一个6层和一个12层的BERT模型。
  • 使用单张TESLA P40 GPU进行训练,应用标准BERT目标:掩码语言建模和下一句预测。
  • 设计自定义分词器以提升加利西亚语词的形态分割效果。
  • 使用标准数据集在词性标注、依存句法分析和命名实体识别(NER)任务上评估模型性能。
  • 在所有任务中与官方多语言BERT(mBERT)模型进行性能对比。
  • 探索两阶段训练策略——先在短序列上进行预训练,再在长序列上微调——尽管受硬件限制影响。

实验结果

研究问题

  • RQ1在有限的加利西亚语数据上训练的单语BERT模型是否能在下游NLP任务中优于mBERT?
  • RQ2当训练数据稀缺时,模型深度(6层与12层)如何影响性能?
  • RQ3两阶段预训练策略是否能提升像加利西亚语这样的低资源语言的模型性能?
  • RQ4自定义分词器在多大程度上提升了加利西亚语BERT模型中的形态表示?
  • RQ5为何mBERT在NER任务中表现优于单语模型,尽管在其他任务中表现较差?

主要发现

  • 12层的Bertinho base模型在所有下游任务中均优于mBERT,包括词性标注、依存句法分析和NER。
  • 6层的Bertinho small模型在大多数任务中也优于mBERT,展现出在计算成本更低情况下的强劲性能。
  • mBERT在NER任务中表现优于Bertinho,尤其是在复杂名称和基于普通名词的组织机构识别方面,尽管部分错误可归因于标准答案标注错误。
  • 两阶段训练策略降低了性能,可能是因为第二阶段因硬件限制导致小批量训练。
  • 自定义分词器提升了形态分割效果,尤其在屈折变化的加利西亚语词上表现更优。
  • 尽管使用的词数少于4500万(少于相关语言如BETO的模型),Bertinho在加利西亚语NLP任务中仍取得了最先进结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。