Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Contextualised Language Modelling for Norwegian

Andrey Kutuzov, Jeremy Barnes|arXiv (Cornell University)|Apr 13, 2021
Topic Modeling参考文献 29被引用 15
一句话总结

本论文提出了 NorELMo 和 NorBERT,这是首个大规模单语上下文嵌入语言模型,专为挪威语设计,基于约 20 亿词的混合 Bokmål 和 Nynorsk 文本进行训练。这些模型在多个自然语言处理任务上优于多语言模型 mBERT 和先前的挪威语基线模型,其中 NorBERT 在跨度抽取任务上实现了 20.6 个百分点的 F1 分数提升,在二分类情感分析任务上实现了 9.4 个百分点的性能增益。

ABSTRACT

We present the ongoing NorLM initiative to support the creation and use of very large contextualised language models for Norwegian (and in principle other Nordic languages), including a ready-to-use software environment, as well as an experience report for data preparation and training. This paper introduces the first large-scale monolingual language models for Norwegian, based on both the ELMo and BERT frameworks. In addition to detailing the training process, we present contrastive benchmark results on a suite of NLP tasks for Norwegian. For additional background and access to the data, models, and software, please see http://norlm.nlpl.eu

研究动机与目标

  • 开发大规模、单语上下文嵌入的挪威语语言模型,以支持高级自然语言处理应用。
  • 解决挪威语缺乏高资源、领域优化语言模型的问题,尤其是在与低资源语言设置相比时。
  • 建立一个可重用、高性能的软件堆栈,用于在北欧高性能计算(HPC)基础设施上训练和部署大规模语言模型。
  • 在多样化的自然语言处理任务上,对单语挪威语模型与多语言模型及先前最先进模型进行基准测试。
  • 通过公开数据、模型和优化训练软件,促进未来模型开发的可持续生态系统。

提出的方法

  • 在包含 19 亿词的混合语料库上训练 NorELMo 和 NorBERT 模型,语料来自 Norsk Aviskorpus、Bokmål Wikipedia 和 Nynorsk Wikipedia。
  • 在 Bokmål 和 Nynorsk 上采用联合训练设置,数据比例反映现实使用情况(Bokmål 占主导)。
  • 使用 Gensim 进行 Wikipedia 数据提取、去分词化和 UTF-8 正常化,使用 Stanza 进行句子分割。
  • 采用完全自动化、模块化的软件堆栈,基于 EasyBuild 构建,专为在国家 HPC 集群(Puhti 和 Saga)上实现 GPU 加速训练而优化。
  • 使用 ELMo 和 BERT 架构进行模型训练,BERT 训练在 4-GPU 节点上通过分布式训练耗时约 3 周。
  • 在包含词性标注、情感分析、否定检测和命名实体识别的基准套件上评估模型,与 mBERT 和 NB-BERT 进行对比。

实验结果

研究问题

  • RQ1在下游挪威语自然语言处理任务中,单语挪威语语言模型(NorELMo 和 NorBERT)与多语言模型(如 mBERT)相比表现如何?
  • RQ2在更大规模的单语挪威语语料上进行训练,在情感分析和命名实体识别等任务上能带来多大程度的性能提升?
  • RQ3模型架构和训练数据组成(如 Bokmål 与 Nynorsk 的比例)如何影响在多样化自然语言处理任务上的表现?
  • RQ4能否在国家级 HPC 基础设施上有效部署一个由社区驱动、开放且可复现的大规模语言模型训练软件堆栈?
  • RQ5NorBERT 和 NorELMo 在不同自然语言处理任务中的相对优势是什么?与先前最先进模型相比表现如何?

主要发现

  • 在二分类情感分析任务上,NorBERT 比 mBERT 提升了 9.4 个百分点,表明在挪威语数据上进行单语预训练具有显著优势。
  • 在跨度抽取任务的 Holder F1 指标上,NorBERT 相较于先前最先进模型实现了 20.6 个百分点的 F1 分数提升。
  • 在否定检测任务中,mBERT 达到了最高的整体 F1 分数,表明多语言预训练可能在语言间结构相似的任务中更具优势。
  • NorELMo 模型在情感分类任务上比 mBERT 提升了 7.3 个百分点,表明即使采用 ELMo 架构,其性能依然出色。
  • NorLM 计划成功地在国家级 HPC 系统上训练并发布了模型,完整的软件堆栈和模型权重均以 CC BY 4.0 许可公开。
  • 基准测试流程表明,模型性能在不同任务间差异显著,凸显了开发多样化、任务特定模型及系统性评估的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。