Skip to main content
QUICK REVIEW

[论文解读] Evaluation of contextual embeddings on less-resourced languages

Matej Ulčar, Aleš Žagar|arXiv (Cornell University)|Jul 22, 2021
Topic Modeling参考文献 47被引用 6
一句话总结

本文首次系统性地评估了 ELMo 和 BERT 在九种低资源欧洲语言中的 14 项任务上的上下文嵌入表现。结果表明,单语 BERT 模型通常优于 ELMo 和多语 BERT,而三语 BERT 模型在跨语言迁移任务中表现尤为出色,尤其是在从英语向相似语言迁移时;尽管如此,ELMo 在依存句法分析和术语对齐任务中仍具有竞争力。

ABSTRACT

The current dominance of deep neural networks in natural language processing is based on contextual embeddings such as ELMo, BERT, and BERT derivatives. Most existing work focuses on English; in contrast, we present here the first multilingual empirical comparison of two ELMo and several monolingual and multilingual BERT models using 14 tasks in nine languages. In monolingual settings, our analysis shows that monolingual BERT models generally dominate, with a few exceptions such as the dependency parsing task, where they are not competitive with ELMo models trained on large corpora. In cross-lingual settings, BERT models trained on only a few languages mostly do best, closely followed by massively multilingual BERT models.

研究动机与目标

  • 评估上下文嵌入模型——ELMo 和 BERT——在大规模预训练资源有限的低资源欧洲语言中的表现。
  • 探究单语 BERT 与多语 BERT 及 ELMo 模型在单语和跨语言设置下的有效性。
  • 评估从英语到低资源语言的跨语言迁移性能,尤其关注低资源语言对的表现。
  • 建立一个涵盖九种语言的 14 项任务基准套件,用于评估低资源环境下的上下文嵌入模型。
  • 比较训练数据规模与模型架构对下游任务性能的影响,特别是在低资源语言中的表现。

提出的方法

  • 评估了两个 ELMo 模型(一个多语,一个单语)和三种 BERT 变体:单语 BERT、大规模多语 BERT(mBERT)以及三语 BERT。
  • 使用了涵盖七类自然语言处理任务的 14 项多样化任务:命名实体识别(NER)、词性标注(POS tagging)、依存句法分析、类比推理、上下文相似度、术语对齐以及 SuperGLUE 基准测试。
  • 通过在目标语言上微调模型,并以英语作为源语言,实施了跨语言迁移,包含零样本和少样本迁移设置。
  • 在语义和术语对齐任务中使用余弦相似度,在序列标注和推理任务中使用标准分类指标。
  • 在语言对之间进行性能比较,包括英语到其他语言以及非英语到其他语言的迁移,结果以准确率@1 和 F1 分数报告。
  • 通过消融实验分析了数据规模的影响,发现即使在 11 亿词元的规模下,某些情况下仍不足以实现优异性能,凸显了数据稀缺是主要瓶颈。

实验结果

研究问题

  • RQ1在多种低资源欧洲语言的单语设置下,单语 BERT 模型与 ELMo 和多语 BERT 的表现如何比较?
  • RQ2在跨语言迁移中,哪种模型架构——三语 BERT、mBERT 还是带跨语言映射的 ELMo——在从英语向低资源语言迁移知识方面表现最佳?
  • RQ3BERT 模型的性能是否显著依赖于预训练语料库的规模,尤其是在低资源设置下?
  • RQ4尽管 BERT 在大多数基准测试中占主导地位,但在哪些自然语言处理任务中 ELMo 仍优于 BERT?
  • RQ5跨语言迁移模型的性能与单语模型相比有多接近?这一差距是否因语言或任务而异?

主要发现

  • 单语 BERT 模型在大多数任务中持续优于 ELMo 和多语 BERT,三语 BERT 模型在部分任务中表现最佳。
  • 在依存句法分析任务中,L-ELMo 模型优于所有 BERT 变体,表明尽管 BERT 整体表现更优,但 ELMo 在句法建模方面仍具优势。
  • 三语 BERT 模型在跨语言术语对齐任务中优于 mBERT 和 ELMo,实现了高达 28.4% 的准确率@1(英语→斯洛文尼亚语迁移)。
  • 在英语→斯拉夫语和芬兰-乌戈尔语语言对中,三语 BERT 模型实现了 21.5% 至 28.4% 的准确率@1,显著优于 mBERT(例如,英语→斯洛文尼亚语为 10.3%)。
  • ELMo 模型在术语对齐任务中表现具有竞争力(例如,英语→瑞典语为 18.7%),在大多数情况下优于 mBERT,但在多数语言对中仍不及三语 BERT。
  • 跨语言迁移的性能下降幅度较小(仅几个百分点),表明即使数据有限,迁移学习仍具可行性,但数据规模仍是关键因素——例如,5 亿词元的数据不足以使 LVBERT 实现优异性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。