Skip to main content
QUICK REVIEW

[论文解读] DTW at Qur'an QA 2022: Utilising Transfer Learning with Transformers for Question Answering in a Low-resource Domain

Damith Premasiri, Tharindu Ranasinghe|arXiv (Cornell University)|May 12, 2022
Topic Modeling被引用 6
一句话总结

本文提出了一种结合迁移学习与集成学习的方法,利用 AraELECTRA 和 CamelBERT 改进低资源《古兰经》文本领域的机器阅读理解。通过在阿拉伯语 MRC 数据集(SOQAL)上微调并应用自集成策略,该方法在《古兰经》问答 2022 年测试集上实现了 0.495 的部分倒数排名(pRR),在低资源宗教 NLP 任务中表现出色。

ABSTRACT

The task of machine reading comprehension (MRC) is a useful benchmark to evaluate the natural language understanding of machines. It has gained popularity in the natural language processing (NLP) field mainly due to the large number of datasets released for many languages. However, the research in MRC has been understudied in several domains, including religious texts. The goal of the Qur'an QA 2022 shared task is to fill this gap by producing state-of-the-art question answering and reading comprehension research on Qur'an. This paper describes the DTW entry to the Quran QA 2022 shared task. Our methodology uses transfer learning to take advantage of available Arabic MRC data. We further improve the results using various ensemble learning strategies. Our approach provided a partial Reciprocal Rank (pRR) score of 0.49 on the test set, proving its strong performance on the task.

研究动机与目标

  • 解决针对《古兰经》等宗教性低资源文本的机器阅读理解(MRC)研究不足的问题。
  • 克服《古兰经》MRC 数据集(1,337 个样本)与 SQuAD 等大规模数据集相比标注数据有限的挑战。
  • 评估从现有阿拉伯语 MRC 资源(如 SOQAL)进行迁移学习的有效性,以提升在《古兰经》MRC 任务中的性能。
  • 探究集成学习是否能增强模型在《古兰经》MRC 基准上的鲁棒性与性能。
  • 提供开源代码、预训练模型及可复现的 Docker 镜像,以支持未来在低资源 NLP 领域的研究。

提出的方法

  • 使用迁移学习在《古兰经》问答 2022 年数据集上微调预训练的 Transformer 模型(AraELECTRA、CamelBERT、mBERT、AraBERTv2)。
  • 从 SOQAL 阿拉伯语 MRC 数据集迁移学习,以提升在较小《古兰经》数据集上的泛化能力与性能。
  • 通过结合多个模型的预测结果,实现自集成学习,以增强模型的鲁棒性与性能。
  • 使用部分倒数排名(pRR)、精确匹配(EM)和 F1@1 作为评估指标,评估模型在验证集和测试集上的表现。
  • 对《古兰经》文本进行预处理,以处理特殊字符与符号,提升模型与标准 NLP 分词器的兼容性。
  • 通过符合 ACL 可复现性标准的 Docker 容器部署实验,并在 GitHub、PyPI 和 Hugging Face 上发布代码、模型与工具。

实验结果

研究问题

  • RQ1在《古兰经》问答 2022 年任务中,集成模型是否相比单模型表现更优?
  • RQ2从其他阿拉伯语 MRC 数据集(如 SOQAL)进行迁移学习是否能提升在低资源《古兰经》MRC 数据集上的性能?
  • RQ3哪种预训练 Transformer 模型架构在《古兰经》MRC 基准上表现最佳?
  • RQ4当训练数据稀缺时,迁移学习如何影响模型的泛化能力?
  • RQ5开源模型与代码是否能加速低资源宗教 NLP 领域的研究?

主要发现

  • 在从 SOQAL 迁移学习后,AraELECTRA-discriminator 模型在验证集上取得了最高的 pRR 得分为 0.616,优于其他模型。
  • 集成学习显著提升了模型的稳定性和性能,最佳集成模型在测试集上实现了 0.495 的 pRR。
  • 从 SOQAL 进行迁移学习使 AraELECTRA-discriminator 的 pRR 从验证集的 0.528 提升至 0.616,证实其在低资源场景下的有效性。
  • 未使用迁移学习的 camelbert-mix 模型 pRR 下降了 47%(从 0.549 降至 0.290),凸显了在低数据环境下迁移学习的重要性。
  • 最终提交结果采用 AraELECTRA-discriminator 并结合迁移学习与集成学习,在测试集上实现了 0.495 的 pRR,为所有提交模型中的最佳表现。
  • 本研究证明,迁移学习与集成方法能有效弥合低资源 MRC 任务中的性能差距,尤其适用于标注数据有限的宗教文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。