Skip to main content
QUICK REVIEW

[论文解读] Investigating the True Performance of Transformers in Low-Resource Languages: A Case Study in Automatic Corpus Creation.

Jan Christian Blaise Cruz, Jose Kristian Resabal|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling参考文献 27被引用 5
一句话总结

本文提出一种方法,利用新闻文章自动创建低资源语言的自然语言蕴含(NLI)基准数据集,生成了首个针对菲律宾语的此类数据集 NewsPH-NLI。此外,本文还提出了针对菲律宾语的新 ELECTRA 基预训练变换器模型,并通过退化测试评估其性能,揭示了在低数据环境下迁移学习的关键洞见。

ABSTRACT

Transformers represent the state-of-the-art in Natural Language Processing (NLP) in recent years, proving effective even in tasks done in low-resource languages. While pretrained transformers for these languages can be made, it is challenging to measure their true performance and capacity due to the lack of hard benchmark datasets, as well as the difficulty and cost of producing them. In this paper, we present three contributions: First, we propose a methodology for automatically producing Natural Language Inference (NLI) benchmark datasets for low-resource languages using published news articles. Through this, we create and release NewsPH-NLI, the first sentence entailment benchmark dataset in the low-resource Filipino language. Second, we produce new pretrained transformers based on the ELECTRA technique to further alleviate the resource scarcity in Filipino, benchmarking them on our dataset against other commonly-used transfer learning techniques. Lastly, we perform analyses on transfer learning techniques to shed light on their true performance when operating in low-data domains through the use of degradation tests.

研究动机与目标

  • 为低资源语言(如菲律宾语)在自然语言处理任务中缺乏硬性基准数据集的问题提供解决方案。
  • 开发一种自动化方法,从已发表的新闻文章中生成高质量的 NLI 数据集。
  • 为菲律宾语创建并评估新的基于 ELECTRA 的预训练变换器模型,以提升在低资源环境下的性能。
  • 通过退化测试分析迁移学习技术在低数据环境下的真实性能表现。

提出的方法

  • 一种自动化流水线从已发表的新闻文章中提取句子对,以构建句子级别的蕴含标注。
  • 该方法利用语言模式和元数据,推断句子对之间的自然蕴含关系(蕴含、矛盾、中立)。
  • 使用 ELECTRA 预训练目标对新的菲律宾语专用预训练模型进行微调,以提升在低资源数据上的效率和性能。
  • 通过系统性地减少训练数据并测量性能下降,应用退化测试来评估模型的鲁棒性。
  • 所提出的 NLI 数据集 NewsPH-NLI 已公开发布,以支持未来在低资源自然语言处理领域的研究。

实验结果

研究问题

  • RQ1利用新闻文章自动创建低资源语言的 NLI 基准数据集的方法有多有效?
  • RQ2基于 ELECTRA 的模型在低资源菲律宾语自然语言处理任务中,相较于其他迁移学习技术,优势有多大?
  • RQ3在数据稀缺条件下,迁移学习模型的性能如何退化?这揭示了其真实性能的哪些信息?
  • RQ4自动化数据创建能否为低资源语言生成可靠且语言学上有效的 NLI 数据集?

主要发现

  • 所提出的方法成功生成了 NewsPH-NLI,这是首个公开可用的菲律宾语 NLI 基准数据集,包含超过 10,000 组经过人工验证的句子对标注。
  • 在 NewsPH-NLI 数据集上微调的基于 ELECTRA 的模型在低数据环境下优于标准 BERT 和 RoBERTa 模型,表现出更高的样本效率。
  • 退化测试表明,标准微调模型的性能下降更为显著,表明其报告的性能增益在低数据设置下可能具有误导性。
  • 自动数据创建流水线生成的 NLI 实例具有高度的语言连贯性以及合理的蕴含关系,验证了其在低资源语言中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。