Skip to main content
QUICK REVIEW

[论文解读] Extracting an English-Persian Parallel Corpus from Comparable Corpora

Akbar Karimi, Ebrahim Ansari|arXiv (Cornell University)|Nov 2, 2017
Natural Language Processing Techniques参考文献 18被引用 14
一句话总结

本文提出一种双向方法,通过利用双向机器翻译和信息检索(IR)系统识别句子级对齐,从可比的维基百科文档中提取高质量的英波平行语料。该方法提升了统计机器翻译(SMT)的性能,并生成了一个按相似度得分排序的、可公开获取的200,000句平行语料库,优于单向方法。

ABSTRACT

Parallel data are an important part of a reliable Statistical Machine Translation (SMT) system. The more of these data are available, the better the quality of the SMT system. However, for some language pairs such as Persian-English, parallel sources of this kind are scarce. In this paper, a bidirectional method is proposed to extract parallel sentences from English and Persian document aligned Wikipedia. Two machine translation systems are employed to translate from Persian to English and the reverse after which an IR system is used to measure the similarity of the translated sentences. Adding the extracted sentences to the training data of the existing SMT systems is shown to improve the quality of the translation. Furthermore, the proposed method slightly outperforms the one-directional approach. The extracted corpus consists of about 200,000 sentences which have been sorted by their degree of similarity calculated by the IR system and is freely available for public access on the Web.

研究动机与目标

  • 为解决统计机器翻译(SMT)中英语-波斯语训练数据稀缺的问题。
  • 开发一种可扩展的方法,用于从可比语料库(如对齐的维基百科版本)中挖掘平行句子。
  • 通过自动提取的平行句子扩充现有训练数据,提升SMT翻译质量。
  • 从对齐质量与下游翻译性能两个方面,评估并比较双向与单向提取策略的表现。

提出的方法

  • 使用文档级对齐将英语和波斯语维基百科文章进行对齐,形成可比语料库。
  • 分别应用两个机器翻译系统:波斯语到英语,以及英语到波斯语,将每种语言的文本翻译成另一种语言。
  • 使用信息检索(IR)系统计算翻译后句子与原始单语句子之间的句子级相似度。
  • 根据相似度得分对提取的句子对进行排序,以筛选并优先选择高质量的平行句子。
  • 仅选择相似度得分较高的句子对,构建最终的平行语料库。
  • 将最终生成的200,000句平行语料库公开,供研究使用。

实验结果

研究问题

  • RQ1双向机器翻译与基于IR的匹配能否有效从可比的英波维基百科语料库中提取高质量的平行句子?
  • RQ2在对齐质量与SMT性能提升方面,双向提取方法相较于单向方法表现如何?
  • RQ3所提取的平行语料库在多大程度上提升了现有SMT系统的翻译质量?
  • RQ4相似度评分对所提取平行数据的可靠性与实用性有何影响?

主要发现

  • 所提出的双向方法在提取高质量平行句子对方面,略优于单向方法。
  • 所提取的语料库包含约200,000对句子,按相似度得分排序,便于使用。
  • 将提取的句子加入现有SMT训练数据后,翻译质量得到提升,证明了该语料库的实用性。
  • 该语料库可公开获取,支持未来在波斯语-英语等低资源语言对上的研究工作。
  • 基于IR的相似度度量能有效识别出有效的平行句子对,即使在缺乏预存在的平行文本的情况下亦然。
  • 尽管波斯语-英语平行数据稀缺,该方法仍表现有效,为低资源机器翻译场景提供了可行解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。