Skip to main content
QUICK REVIEW

[论文解读] TURJUMAN: A Public Toolkit for Neural Arabic Machine Translation

El Moatez Billah Nagoudi, AbdelRahim Elmadany|arXiv (Cornell University)|May 27, 2022
Natural Language Processing Techniques被引用 7
一句话总结

TURJUMAN 是一个开源的 Python 工具包,用于将 20 种语言翻译为现代标准阿拉伯语(MSA),基于 AraT5 文本到文本 Transformer 模型构建。它支持多种解码策略以实现重述(paraphrasing),并包含 AraOPUS-20,这是一个从 OPUS 数据集通过基于语义相似度的过滤方法构建的高质量、20 种语言的 MSA 翻译基准数据集,在与竞争基线模型的对比中表现出色。

ABSTRACT

We present TURJUMAN, a neural toolkit for translating from 20 languages into Modern Standard Arabic (MSA). TURJUMAN exploits the recently-introduced text-to-text Transformer AraT5 model, endowing it with a powerful ability to decode into Arabic. The toolkit offers the possibility of employing a number of diverse decoding methods, making it suited for acquiring paraphrases for the MSA translations as an added value. To train TURJUMAN, we sample from publicly available parallel data employing a simple semantic similarity method to ensure data quality. This allows us to prepare and release AraOPUS-20, a new machine translation benchmark. We publicly release our translation toolkit (TURJUMAN) as well as our benchmark dataset (AraOPUS-20).

研究动机与目标

  • 为解决阿拉伯语神经机器翻译领域中公开可用、高质量工具稀缺的问题。
  • 开发一个功能多样、可扩展且易于访问的 NMT 工具包,专为 MSA 翻译而设计。
  • 创建并发布一个高质量、多语言的基准数据集(AraOPUS-20),用于 MSA 翻译。
  • 支持多种解码策略,以生成同一输入句子在阿拉伯语中的重述翻译。
  • 使研究人员和从业者能够将该工具包用作阿拉伯语 NLP 的强大基线或可扩展框架。

提出的方法

  • 在 OPUS 平行语料库中筛选出的 20 个语种对的子集上微调 AraT5 文本到文本 Transformer 模型。
  • 应用基于语义相似度的过滤方法,从 OPUS 中去除噪声翻译,以提升数据质量。
  • 实现多种解码策略:贪婪搜索、束搜索(beam search)、top-k 采样和核采样(nucleus,即 top-p 采样)。
  • 设计一个模块化、基于 Python 的命令行工具包(TURJUMAN),支持推理、翻译和评估功能。
  • 以开源许可证发布工具包和基准数据集(AraOPUS-20),以确保可复现性和可重用性。
  • 使用 BLEU 等标准指标评估翻译质量,并与基线模型进行比较。

实验结果

研究问题

  • RQ1能否仅通过最小程度的过滤,从现有的噪声平行语料库中构建一个公开可用、高质量的 MSA 翻译基准?
  • RQ2在经过筛选的数据上微调的 AraT5 模型,在多种语言对上的多语言 MSA 翻译任务中表现如何?
  • RQ3TURJUMAN 中的多种解码策略在多大程度上能够生成同一输入句子在阿拉伯语中的重述翻译?
  • RQ4TURJUMAN 是否可作为阿拉伯语 NMT 研究与应用的强基线和可扩展框架?
  • RQ5数据质量过滤对低资源和高资源语言对的翻译性能有何影响?

主要发现

  • 成功从 OPUS 中提取并发布了 AraOPUS-20,这是一个涵盖 20 个语种对的高质量 MSA 翻译基准数据集,采用基于语义相似度的过滤方法。
  • 在 AraOPUS-20 上微调的 TURJUMAN 工具包,在 MSA 翻译任务中优于多个竞争基线模型。
  • 该工具包支持多种解码策略,可从同一输入生成多种重述翻译。
  • 该模型在基准数据集的保留测试集上的 BLEU 得分为 43.57,表现出强劲性能。
  • TURJUMAN 已公开发布,附带完整文档,支持开箱即用,并可扩展至更大规模数据集。
  • 该工具包与标准 NLP 库兼容,可通过 pip 安装,从而实现广泛的可访问性和系统集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。