QUICK REVIEW
[论文解读] Spanish Language Models.
Asier Gutiérrez-Fandiño, Jordi Armengol-Estapé|arXiv (Cornell University)|Jul 15, 2021
Topic Modeling参考文献 19被引用 20
一句话总结
本论文介绍了基于西班牙国家图书馆网络爬取数据(2009–2019年)中清洗并去重的570GB西班牙语语料库预训练的西班牙语 RoBERTa-base 和 RoBERTa-large 语言模型。这些模型在多个自然语言处理任务中达到最先进性能,包括扩展的抽取式问答基准测试,优于现有的西班牙语模型。
ABSTRACT
This paper presents the Spanish RoBERTa-base and RoBERTa-large models, as well as the corresponding performance evaluations. Both models were pre-trained using the largest Spanish corpus known to date, with a total of 570GB of clean and deduplicated text processed for this work, compiled from the web crawlings performed by the National Library of Spain from 2009 to 2019. We extended the current evaluation datasets with an extractive Question Answering dataset and our models outperform the existing Spanish models across tasks and settings.
研究动机与目标
- 通过利用目前已知最大的西班牙语语料库,开发高性能的西班牙语语言模型。
- 通过扩展评估基准,提升下游自然语言处理任务(尤其是问答任务)的性能。
- 通过在大规模、高质量数据集上进行预训练,为西班牙语自然语言处理建立新的最先进结果。
- 为西班牙语自然语言处理研究与应用社区提供强大且公开可用的语言模型。
提出的方法
- 在西班牙国家图书馆于2009–2019年期间通过网络爬取获得的570GB清洗并去重的西班牙语文本上,对 RoBERTa-base 和 RoBERTa-large 模型进行预训练。
- 采用 RoBERTa 的训练目标,即掩码语言建模和下一句预测,针对西班牙语进行适配。
- 在下游自然语言处理任务(包括新引入的抽取式问答数据集)上应用标准的 RoBERTa 微调流程。
- 采用数据去重和过滤技术,确保训练数据的高质量,以提升模型的泛化能力。
- 在多个标准和扩展基准上评估性能,以证明模型在各类任务中的稳健性和泛化能力。
实验结果
研究问题
- RQ1大规模、高质量的西班牙语语料库是否能显著提升预训练语言模型的性能?
- RQ2所提出的 RoBERTa-base 和 RoBERTa-large 模型在标准和扩展的自然语言处理基准上与现有西班牙语模型相比表现如何?
- RQ3通过引入抽取式问答基准扩展评估数据集,在多大程度上提升了模型评估的精确度?
- RQ4这些模型在西班牙语的多样化自然语言处理任务中是否具备有效的泛化能力?
主要发现
- RoBERTa-base 和 RoBERTa-large 模型在所有评估任务中均优于此前发布的所有西班牙语语言模型。
- 模型在扩展的抽取式问答数据集上达到最先进性能,展现出在跨度预测和答案准确率方面的卓越表现。
- 使用570GB清洗并去重的西班牙语语料库显著提升了模型性能,相较于较小或质量较低的训练数据有明显优势。
- 模型在多样化自然语言处理任务中表现出强大的泛化能力,表明其在西班牙语自然语言处理应用中具备稳健性和广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。