Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Machine Translation between Arabic and Hebrew: Available Corpora and Initial Results

Yonatan Belinkov, James Glass|arXiv (Cornell University)|Sep 25, 2016
Natural Language Processing Techniques参考文献 29被引用 9
一句话总结

本文针对阿拉伯语-希伯来语翻译任务,基于新发布的平行语料库,对基于短语的机器翻译(PBMT)与神经机器翻译(NMT)进行了大规模对比研究。结果表明,字符级神经模型显著优于传统的形态感知分词方法,其中NMT系统在使用未知词替换与字符级编码时,BLEU得分达到10.86,标志着低资源闪米特语系翻译的重要进展。

ABSTRACT

Machine translation between Arabic and Hebrew has so far been limited by a lack of parallel corpora, despite the political and cultural importance of this language pair. Previous work relied on manually-crafted grammars or pivoting via English, both of which are unsatisfactory for building a scalable and accurate MT system. In this work, we compare standard phrase-based and neural systems on Arabic-Hebrew translation. We experiment with tokenization by external tools and sub-word modeling by character-level neural models, and show that both methods lead to improved translation performance, with a small advantage to the neural models.

研究动机与目标

  • 解决阿拉伯语-希伯来语机器翻译中平行语料匮乏的问题,尽管这两种语言在语言和文化上具有重要意义。
  • 克服以往方法(如通过英语中转或基于规则的系统)的局限性,这些方法存在信息丢失或鲁棒性差的问题。
  • 评估形态感知分词与字符级神经建模在提升形态丰富型闪米特语系翻译质量方面的有效性。
  • 基于WIT3 TED演讲语料库,为阿拉伯语-希伯来语翻译建立基准,以支持未来的对比研究。
  • 研究子词建模与通过注意力机制实现的未知词替换对翻译性能的影响。

提出的方法

  • 在来自TED演讲的大规模阿拉伯语-希伯来语平行语料库上,训练并对比标准的基于短语的MT(PBMT)与神经MT(NMT)系统。
  • 使用外部分词工具(Farasa与MADAMIRA)处理阿拉伯语与希伯来语中的形态复杂性。
  • 通过基于CNN的编码器实现字符级神经模型,以处理子词单元,减少未登录词问题。
  • 通过注意力权重将未知词标记与源端对应词对齐,实现基于注意力的未知词替换。
  • 使用Moses工具包实现PBMT,使用带有注意力机制的序列到序列NMT框架实现神经模型。
  • 采用BLEU与Meteor得分进行系统评估,并通过标准统计方法进行显著性检验。

实验结果

研究问题

  • RQ1在使用新发布的平行语料库的前提下,神经机器翻译能否在阿拉伯语-希伯来语翻译中超越基于短语的MT?
  • RQ2形态感知分词在阿拉伯语-希伯来语MT中的性能提升程度如何?
  • RQ3与传统分词工具相比,字符级神经模型在处理形态丰富性方面有多高效?
  • RQ4基于注意力机制的未知词替换是否能提升NMT系统的翻译质量?
  • RQ5在可用训练数据规模有限的情况下,模型大小与架构对性能有何影响?

主要发现

  • 神经MT系统优于基于短语的MT,采用字符级建模与未知词替换时,BLEU得分为10.86,而PBMT为9.31。
  • 采用未知词替换的字符级NMT模型(10.86 BLEU)显著优于所有PBMT变体,包括使用分词的版本。
  • 使用Farasa与MADAMIRA进行分词可使PBMT性能略有提升(BLEU:9.51–9.63),但提升不具统计显著性。
  • 采用字符级编码的NMT模型(10.65 BLEU)相较于标准NMT(9.91 BLEU)表现出显著且统计显著的性能提升。
  • 通过注意力权重实现的未知词替换带来可测量的性能提升,BLEU从10.65提升至10.86。
  • 更大的、更深的NMT模型并未带来显著性能增益,表明数据规模限制了模型容量的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。