Skip to main content
QUICK REVIEW

[论文解读] ARBERT & MARBERT: Deep Bidirectional Transformers for Arabic

Muhammad Abdul-Mageed, AbdelRahim Elmadany|arXiv (Cornell University)|Dec 27, 2020
Natural Language Processing Techniques被引用 10
一句话总结

本文提出了 ARBERT 和 MARBERT,这两种基于深度双向 Transformer 的语言模型,通过在大规模、多样化的阿拉伯语语料库(包括社交媒体和多种方言)上进行预训练,以提升多语言及低资源阿拉伯语自然语言处理任务的性能。作者还提出了 ARLUE,一个包含 42 个数据集的新型基准,涵盖六个任务类别,在该基准上,其模型取得了最先进性能(ARLUE 得分为 77.40),即使模型规模仅为 XLM-R Large 的 1/3.4,仍表现更优,且更具能效优势。

ABSTRACT

Pre-trained language models (LMs) are currently integral to many natural language processing systems. Although multilingual LMs were also introduced to serve many languages, these have limitations such as being costly at inference time and the size and diversity of non-English data involved in their pre-training. We remedy these issues for a collection of diverse Arabic varieties by introducing two powerful deep bidirectional transformer-based models, ARBERT and MARBERT. To evaluate our models, we also introduce ARLUE, a new benchmark for multi-dialectal Arabic language understanding evaluation. ARLUE is built using 42 datasets targeting six different task clusters, allowing us to offer a series of standardized experiments under rich conditions. When fine-tuned on ARLUE, our models collectively achieve new state-of-the-art results across the majority of tasks (37 out of 48 classification tasks, on the 42 datasets). Our best model acquires the highest ARLUE score (77.40) across all six task clusters, outperforming all other models including XLM-R Large (~ 3.4 x larger size). Our models are publicly available at https://github.com/UBC-NLP/marbert and ARLUE will be released through the same repository.

研究动机与目标

  • 为解决现有多语言及单语模型在处理多样化阿拉伯语方言和真实文本(如社交媒体)方面的局限性。
  • 开发高效、高性能的阿拉伯语语言模型,使其在推理效率和能耗方面优于更大规模的模型。
  • 创建一个标准化、全面的阿拉伯语 NLP 评估基准,支持多种方言和真实应用场景。
  • 克服现有阿拉伯语模型(如 AraBERT)评估范围狭窄和数据多样性不足的问题。
  • 通过利用大规模、领域多样的预训练数据,实现更优的迁移学习能力。

提出的方法

  • 在包含社交媒体、新闻和方言文本等大规模多样化阿拉伯语语料上,使用深度双向 Transformer 对 ARBERT 和 MARBERT 进行预训练。
  • 采用掩码语言建模目标并结合下一句预测,针对阿拉伯语的形态丰富性和书写系统多样性进行适配。
  • 设计 MARBERT-v2 时采用增强架构并使用更大规模的预训练数据,包括大规模社交媒体数据集,以提升真实场景下的鲁棒性。
  • 通过整理和标准化 42 个现有的阿拉伯语 NLP 数据集,构建 ARLUE 基准,形成六个逻辑清晰的任务类别。
  • 通过在单个数据集上微调并进行类别层面聚合来评估模型,报告统一的 ARLUE 得分以供模型比较。
  • 通过使用基础尺寸模型优化推理效率,使其在性能上超越更大的多语言模型(如 XLM-R Large)。

实验结果

研究问题

  • RQ1在阿拉伯语 NLP 任务中,是否一个在多样化大规模数据上预训练的单语阿拉伯语语言模型,能够超越更大规模的多语言模型(如 XLM-R Large)?
  • RQ2在社交媒体和方言文本上预训练的模型,在低资源和真实场景下的阿拉伯语 NLP 应用中,其泛化能力有多强?
  • RQ3像 ARLUE 这样的标准化基准,在实现公平、全面且可复现的阿拉伯语 NLP 模型评估方面有多有效?
  • RQ4在阿拉伯语方言上进行训练的模型,是否能显著提升在多种方言上的性能,相较于仅专注于现代标准阿拉伯语的模型?
  • RQ5在准确率、效率和能耗方面,基础尺寸模型与更大规模模型相比表现如何?

主要发现

  • ARBERT 和 MARBERT 在 ARLUE 基准的 48 项独立分类任务中,有 37 项达到最先进水平。
  • 最佳模型取得了 77.40 的 ARLUE 得分,尽管模型规模仅为 XLM-R Large 的 1/3.4,仍表现更优,且更具能效。
  • MARBERT 在所有任务类别和单个数据集上均优于当时最先进的阿拉伯语模型 AraBERT。
  • 由于在多样化真实世界数据上进行预训练,模型在低资源和非正式文本(包括社交媒体)上表现出强大的泛化能力。
  • ARLUE 被证明是一个稳健且全面的基准,能够实现对六个不同阿拉伯语 NLP 任务类别的公平且系统化的评估。
  • 结果证实,大规模、领域多样的预训练对于构建服务多样化语言群体的有效阿拉伯语 NLP 模型至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。