Skip to main content
QUICK REVIEW

[论文解读] A Warm Start and a Clean Crawled Corpus -- A Recipe for Good Language Models

Vésteinn Snæbjarnarson, Haukur Barri Símonarson|arXiv (Cornell University)|Jan 14, 2022
Natural Language Processing Techniques被引用 10
一句话总结

本文提出了 IceBERT,一种基于清洗过的网络爬取单语语料库(IC3)和精心整理的冰岛语 Gigaword 语料库训练的冰岛语最先进的语言模型。通过从多语言模型进行热启动,并使用高质量、领域针对性的网络数据,作者在词性标注、命名实体识别、语法错误检测和句法分析等任务上实现了最先进性能,证明了经过清洗的大规模网络爬取数据在低资源至中等资源语言中可与精心整理的语料库相媲美。

ABSTRACT

We train several language models for Icelandic, including IceBERT, that achieve state-of-the-art performance in a variety of downstream tasks, including part-of-speech tagging, named entity recognition, grammatical error detection and constituency parsing. To train the models we introduce a new corpus of Icelandic text, the Icelandic Common Crawl Corpus (IC3), a collection of high quality texts found online by targeting the Icelandic top-level-domain (TLD). Several other public data sources are also collected for a total of 16GB of Icelandic text. To enhance the evaluation of model performance and to raise the bar in baselines for Icelandic, we translate and adapt the WinoGrande dataset for co-reference resolution. Through these efforts we demonstrate that a properly cleaned crawled corpus is sufficient to achieve state-of-the-art results in NLP applications for low to medium resource languages, by comparison with models trained on a curated corpus. We further show that initializing models using existing multilingual models can lead to state-of-the-art results for some downstream tasks.

研究动机与目标

  • 通过在有限语言资源下开发高性能语言模型,提升冰岛语自然语言处理能力。
  • 评估清洗过的网络爬取语料库是否能在低资源环境下实现与精心整理的单语语料库相当或更优的性能。
  • 研究使用多语言预训练权重(热启动)初始化模型在下游冰岛语自然语言处理任务中的有效性。
  • 建立一种可复现的方法,用于从网络中提取并清洗高质量语言数据,以服务于资源较少的语言。
  • 通过手动翻译和适配冰岛语版本的 WinoGrande 共识推理数据集,提升评估标准。

提出的方法

  • 构建了冰岛语通用爬网语料库(IC3),通过聚焦 .is 顶级域名并筛选语言相关性,形成包含 16GB 冰岛语文本的高质量数据集。
  • 收集并整合了其他公开的冰岛语文本来源,形成包含 27 亿词符的综合性单语训练语料库。
  • 采用热启动策略,对多语言模型(如 XLM-R-base)进行微调,在 IC3 语料库上继续预训练,以适应冰岛语。
  • 实施了一种新颖的数据清洗流程,从网络爬取文本中去除模板内容、重复项和低质量内容。
  • 使用标准 BERT 风格的预训练方法,在清洗后的单语数据上训练多个基于 Transformer 的语言模型,包括 IceBERT。
  • 通过手动翻译和语言学适配,将 WinoGrande 数据集转化为冰岛语,以支持对共识推理能力的稳健评估。

实验结果

研究问题

  • RQ1大规模清洗过的网络爬取语料库是否能在冰岛语自然语言处理任务中实现与基于精心整理语料库训练的模型相当的最先进性能?
  • RQ2使用多语言预训练模型(热启动)初始化语言模型是否能提升其在下游冰岛语任务中的性能?
  • RQ3在低资源至中等资源环境下,高质量、领域针对性的网络爬取(IC3)与传统精心整理的语料库相比,效果如何?
  • RQ4在单一语言(冰岛语)上训练的语言模型在冰岛语特定任务中,能在多大程度上超越多语言模型?
  • RQ5通过手动适配的共识推理数据集是否能提升冰岛语自然语言处理的评估严谨性与基线性能?

主要发现

  • 在清洗后的 IC3 语料库上训练的 IceBERT 在多个下游任务中实现了最先进性能,包括词性标注、命名实体识别和短语结构解析。
  • 在清洗后的网络爬取语料库(IC3)上训练的模型性能与在精心整理的冰岛语 Gigaword 语料库上训练的模型相当,证明了在充分清洗后,网络爬取数据具有可行性。
  • 热启动方法——在冰岛语数据上微调 XLM-R-base——在命名实体识别和语法错误检测任务中取得了最先进结果。
  • 手动翻译并适配的冰岛语 WinoGrande 数据集为共识推理提供了更稳健、更具语言相关性的评估基准。
  • 通过针对性 .is 域名爬取提取的 IC3 语料库在训练高性能模型方面表现有效,表明该方法可推广至其他低资源语言。
  • 本研究证实,对于冰岛语这类语言,结合清洗过的大型网络爬取语料库与多语言模型的热启动策略,可在无需大量精心整理数据的情况下实现最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。