Skip to main content
QUICK REVIEW

[论文解读] Improving Large-scale Language Models and Resources for Filipino

Jan Christian Blaise Cruz, Charibeth Cheng|arXiv (Cornell University)|Nov 11, 2021
Natural Language Processing Techniques参考文献 18被引用 16
一句话总结

本文提出了 TLUnified,一个大规模、多样化的他加禄语预训练语料库,并在该语料库上微调基于 RoBERTa 的语言模型。新模型在三个基准任务(仇恨言论检测、登革热症状分类和自然语言推理)中实现了显著的性能提升——平均测试准确率提高 4.47%,优于先前的他加禄语模型(如 BERT 和 ELECTRA)。

ABSTRACT

In this paper, we improve on existing language resources for the low-resource Filipino language in two ways. First, we outline the construction of the TLUnified dataset, a large-scale pretraining corpus that serves as an improvement over smaller existing pretraining datasets for the language in terms of scale and topic variety. Second, we pretrain new Transformer language models following the RoBERTa pretraining technique to supplant existing models trained with small corpora. Our new RoBERTa models show significant improvements over existing Filipino models in three benchmark datasets with an average gain of 4.47% test accuracy across the three classification tasks of varying difficulty.

研究动机与目标

  • 通过创建一个更大、更广泛的语料库,解决低资源他加禄语缺乏大规模、多样化预训练数据的问题。
  • 通过在比以往可用的更大、更多样化的数据集上训练基于 RoBERTa 的架构,提升他加禄语语言模型的性能。
  • 通过在下游分类任务中展示更高的准确率,超越现有的他加禄语模型(如 BERT 和 ELECTRA)。
  • 通过预训练阶段提升数据质量和主题多样性,增强他加禄语 NLP 模型的鲁棒性和泛化能力。
  • 为未来的研究和应用提供开源的、最先进的他加禄语 RoBERTa 模型。

提出的方法

  • 通过聚合多种多语言双语语料(如 Bible-UEdin、ParaCrawl、TED2020)、OSCAR 的他加禄语子集,以及 NewsPH 新闻语料库的 60% 子集,构建 TLUnified。
  • 应用五步过滤:非拉丁字符过滤(非拉丁字符占比 >15%)、长度过滤(4–150 个词符)、标点符号过滤(过多标点)、平均词长过滤(词长比率 3–18)、HTML/URL 过滤。
  • 执行去重处理,并使用 32,000 个子词和 100% 字符覆盖率训练 BPE Tokenizer,同时保留大小写敏感性。
  • 使用与原始 RoBERTa 论文一致的超参数,基于 RoBERTa 预训练目标(掩码语言建模)预训练 RoBERTa-base 和 RoBERTa-large 模型。
  • 在三个基准数据集上微调模型:Hatespeech(多标签)、Dengue(多标签)和 NewsPH-NLI Medium(自然语言推理),序列长度为 128–256 个词符。
  • 为 Hatespeech 和 Dengue 任务在词汇表中添加特殊标记([LINK]、[MENTION]、[HASHTAG]),通过平均子词向量初始化其嵌入。

实验结果

研究问题

  • RQ1与较小、主题狭窄的数据集相比,更大、更多样化的预训练语料库是否能显著提升他加禄语语言模型的性能?
  • RQ2在新的 TLUnified 语料库上训练基于 RoBERTa 的模型,是否能在他加禄语的下游分类任务中带来可测量的性能提升?
  • RQ3新 RoBERTa 模型在性能上与现有最先进模型(如 BERT 和 ELECTRA)相比如何?
  • RQ4当预训练数据仍然有限时,模型规模(base 与 large)在性能提升中的贡献程度如何?
  • RQ5包含多样化、高质量且经过过滤的多语言双语语料和新闻数据,是否能增强他加禄语 NLP 模型的鲁棒性?

主要发现

  • RoBERTa Large 模型在仇恨言论检测任务中,相较于最佳现有模型(BERT Base)实现了 4.07% 的绝对准确率提升。
  • RoBERTa Large 模型在登革热症状分类任务中,相较于 BERT Base 实现了 5.3% 的测试准确率提升,是所有基准中最大的改进。
  • RoBERTa Large 模型在 NewsPH-NLI Medium 自然语言推理任务中,相较于 ELECTRA Base 实现了 4.04% 的测试准确率提升。
  • RoBERTa Base 模型在所有三项任务中均优于 BERT Base 和 ELECTRA Base,分别在 Hatespeech 上提升 +3.9%、在 Dengue 上提升 +4.4%、在 NLI 上提升 +3.95%。
  • RoBERTa Base 与 RoBERTa Large 之间的性能差距极小——Hatespeech 上仅 +0.17%,Dengue 上 +0.9%,NLI 上 +0.09%,表明当前的 TLUnified 语料库可能尚未完全发挥大模型的潜力。
  • 在所有三项任务上的平均测试准确率提升为 4.47%,证明了改进的预训练数据和 RoBERTa 微调策略带来了持续且显著的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。