Skip to main content
QUICK REVIEW

[论文解读] MIZAN: A Large Persian-English Parallel Corpus

Omid Kashefi|arXiv (Cornell University)|Jan 7, 2018
Natural Language Processing Techniques参考文献 18被引用 8
一句话总结

本论文介绍了 MIZAN,这是目前公开可用的最大规模波斯语-英语平行语料库,包含超过 100 万个句子对,其文本由数字化的、无版权的文学作品经人工整理而成。该语料库可显著提升统计机器翻译(SMT)性能,在领域内测试集上达到 27.84 的 BLEU 分数,表明针对形态特征的模型以及针对动词的对齐改进,可显著提升波斯语-英语等低资源语言对的翻译质量。

ABSTRACT

One of the most major and essential tasks in natural language processing is machine translation that is now highly dependent upon multilingual parallel corpora. Through this paper, we introduce the biggest Persian-English parallel corpus with more than one million sentence pairs collected from masterpieces of literature. We also present acquisition process and statistics of the corpus, and experiment a base-line statistical machine translation system using the corpus.

研究动机与目标

  • 为解决统计机器翻译(SMT)中缺乏大规模、高质量波斯语-英语平行语料库的问题。
  • 从文学文本中构建一个公开可访问、人工对齐的语料库,以支持低资源语言的自然语言处理研究。
  • 评估波斯语-英语翻译任务中基线 SMT 的性能,并识别对齐与形态学方面的关键挑战。
  • 通过形态感知处理与针对性的动词对齐改进,探索提升 SMT 性能的方法。
  • 为未来波斯语-英语机器翻译与跨语言 NLP 研究提供基准资源。

提出的方法

  • 从 Project Gutenberg 收集了 500 本英文文学作品,并从伊朗国家图书馆中识别出 180 本具有对应波斯语译本的作品。
  • 由于 OCR 错误率较高(WER ≈ 30%),波斯语文本通过人工打字方式数字化,以确保文本质量。
  • 使用 Virastyar 工具包进行标准化处理,包括统一 Unicode 字符、去除可选符号、统一 ezafe 使用方式,并修正词内空格问题。
  • 首先使用对应得分模型进行自动章节级对齐,随后通过定制软件工具结合专家判断完成句子级对齐。
  • 使用 Moses 工具包训练基线 SMT 系统,并通过与参考译文及后期编辑译文对比,以 BLEU 分数评估性能。
  • 通过添加 300 个常见英语动词及其波斯语对应词,并应用词形还原技术,减少屈折形式不匹配问题。

实验结果

研究问题

  • RQ1大规模人工对齐的波斯语-英语平行语料库在提升基线 SMT 性能方面有多有效?
  • RQ2波斯语-英语 SMT 中翻译错误的主要原因是什么,特别是动词对齐与词序差异方面?
  • RQ3形态感知处理在多大程度上能提升波斯语-英语翻译的 SMT 输出质量?
  • RQ4后期编辑如何影响 BLEU 分数评估?其结果揭示了人类对流畅度的何种期望?
  • RQ5针对性地添加动词对与词形还原是否能显著降低不同测试集间的性能差异?

主要发现

  • MIZAN 语料库包含 1,000,000 个句子对与 2500 万个词项,是目前公开可用的最大波斯语-英语平行语料库。
  • 基线 SMT 在保留测试集上达到 27.84 的 BLEU 分数,在 EiT 测试集上达到 39.86,表明性能中等。
  • 对 100 个随机输出进行后期编辑后,BLEU 分数分别提升至 51.59 和 57.35,表明经少量修正后约 50% 的翻译可达到人类流畅标准。
  • 添加 300 个动词对后 BLEU 分数提升,表明长距离动词对齐与词序重排是关键挑战。
  • 词形还原使输出与参考译文之间的词数减少差距降低了 18–27%,表明形态感知模型可显著提升 SMT 性能。
  • 形态学统计分析显示,输出中的屈折词比例比参考译文低 24–27%,凸显当前 SMT 系统在波斯语处理中的关键失败点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。