Skip to main content
QUICK REVIEW

[论文解读] AraBART: a Pretrained Arabic Sequence-to-Sequence Model for Abstractive Summarization

Moussa Kamal Eddine, Nadi Tomeh|arXiv (Cornell University)|Mar 21, 2022
Topic Modeling被引用 6
一句话总结

AraBART 是首个用于阿拉伯语抽象摘要的端到端预训练序列到序列模型,利用 BART 的去噪自编码器目标,联合预训练编码器、解码器和注意力权重。它在多个抽象摘要基准测试中达到最先进性能,优于基于 BERT 的模型以及更大的多语言模型如 mBART25,尤其在更抽象的数据集(如 XL-Sum)上表现更优。

ABSTRACT

Like most natural language understanding and generation tasks, state-of-the-art models for summarization are transformer-based sequence-to-sequence architectures that are pretrained on large corpora. While most existing models focused on English, Arabic remained understudied. In this paper we propose AraBART, the first Arabic model in which the encoder and the decoder are pretrained end-to-end, based on BART. We show that AraBART achieves the best performance on multiple abstractive summarization datasets, outperforming strong baselines including a pretrained Arabic BERT-based model and multilingual mBART and mT5 models.

研究动机与目标

  • 解决阿拉伯语抽象摘要领域缺乏端到端预训练序列到序列模型的问题。
  • 克服现有模型仅预训练编码器或使用非预训练解码器的局限性。
  • 通过联合预训练编码器、解码器和注意力权重,提升阿拉伯语抽象摘要的忠实度和流畅度。
  • 在多样化的抽象摘要数据集上进行评估,包括使用较少的阿拉伯语 Gigaword 和多语言 XL-Sum,以衡量在不同抽象程度下的性能表现。
  • 证明端到端预训练能带来更优性能,尤其在更抽象的摘要任务中表现更佳。

提出的方法

  • 采用 BART base 架构,包含 6 个编码器层和 6 个解码器层,隐藏层维度为 768,参数量为 139M,并针对阿拉伯语进行微调。
  • 在预训练语料库的 20GB 子集上使用 sentencepiece 进行分词,词汇表大小为 50K,字符覆盖率达 99.99%,以最小化未登录词(OOV)数量。
  • 使用 BART 的去噪自编码器目标对 AraBART 进行预训练:文本填空(30% 的掩码跨度使用 [MASK])和句子重排。
  • 使用 128 块 V100 GPU 训练约 60 小时,采用 Adam 优化器,配合线性学习率预热和衰减,使用 FP16 精度,并增加层归一化以提升稳定性。
  • 在两个抽象摘要数据集上进行微调:阿拉伯语 Gigaword(标题生成)和 XL-Sum(多语言、来源类型多样)。
  • 使用 ROUGE-L、BERTScore 和新颖 n-gram 比率评估,以衡量抽象程度和事实一致性。

实验结果

研究问题

  • RQ1与仅预训练编码器的模型相比,端到端预训练序列到序列模型是否能提升阿拉伯语抽象摘要的性能?
  • RQ2AraBART 是否在阿拉伯语抽象摘要任务中优于更大的多语言模型(如 mBART25),尤其是在更抽象的数据集上?
  • RQ3抽象程度(通过新颖 n-gram 衡量)与 AraBART 相对于基线模型的性能提升之间是否存在相关性?
  • RQ4AraBART 在多样化的阿拉伯语摘要数据集上的表现如何,包括不同抽象程度和来源类型的数据?
  • RQ5编码器、解码器和注意力权重的联合预训练在多大程度上提升了生成摘要的事实一致性和流畅度?

主要发现

  • AraBART 在阿拉伯语 Gigaword 和 XL-Sum 数据集上均达到最先进性能,优于基于 BERT 的模型以及更大的多语言模型如 mBART25。
  • 在 XL-Sum 上,AraBART 的 ROUGE-L 分数比 mBART25 高出 2.9 个百分点,且在最抽象的子集上性能差距最大。
  • 模型相对于基线的性能差距与抽象程度正相关,BERTScore 差值与新颖三元组比率之间的皮尔逊相关系数为 0.6625(p < 0.05)。
  • 尽管参数量更少,AraBART 在 XL-Sum 上仍优于 mT5,证明了语言特定预训练的优势。
  • 在 Gigaword 的 QDS 子集上,AraBART 表现不如 mBART25,表明可能存在数据集特定的局限性或分布偏移。
  • 该模型生成的摘要中,新颖 n-gram 比例更高(例如,在 XL-Sum 上达到 95.2% 的新颖三元组),证实其具备强大的抽象生成能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。