Skip to main content
QUICK REVIEW

[论文解读] Examining the Tip of the Iceberg: A Data Set for Idiom Translation

Marzieh Fadaee, Arianna Bisazza|arXiv (Cornell University)|Feb 13, 2018
Natural Language Processing Techniques参考文献 17被引用 10
一句话总结

本文提出了首个大规模、自动生成的德语-英语习语翻译平行语料库,用于神经机器翻译,包含1,500个含习语的测试句和450万条带习语标注的训练句。作者使用针对习语特异性准确率的新颖指标评估神经网络与短语基于的机器翻译系统,结果表明:尽管整体BLEU得分略有下降,但通过习语标记进行针对性建模,仍能提升习语翻译的准确性。

ABSTRACT

Neural Machine Translation (NMT) has been widely used in recent years with significant improvements for many language pairs. Although state-of-the-art NMT systems are generating progressively better translations, idiom translation remains one of the open challenges in this field. Idioms, a category of multiword expressions, are an interesting language phenomenon where the overall meaning of the expression cannot be composed from the meanings of its parts. A first important challenge is the lack of dedicated data sets for learning and evaluating idiom translation. In this paper we address this problem by creating the first large-scale data set for idiom translation. Our data set is automatically extracted from a widely used German-English translation corpus and includes, for each language direction, a targeted evaluation set where all sentences contain idioms and a regular training corpus where sentences including idioms are marked. We release this data set and use it to perform preliminary NMT experiments as the first step towards better idiom translation.

研究动机与目标

  • 解决当前神经机器翻译中缺乏专门用于训练和评估习语翻译的大规模平行语料库的问题。
  • 探究当前最先进的神经机器翻译系统在翻译习语与一般短语时的性能差距。
  • 开发并发布一个基准数据集,包含针对性的测试集和带标注的训练数据,用于德语-英语翻译中的习语表达。
  • 使用标准指标与新颖的、专用于习语的指标,评估神经机器翻译与短语基于机器翻译系统在习语翻译上的表现。
  • 证明即使整体BLEU得分下降,通过习语标记进行针对性建模,仍可提升习语翻译的准确性。

提出的方法

  • 从通用德语-英语平行语料库中自动提取1,500对含习语的句子对,确保源句和目标句均包含习语。
  • 构建一个包含450万条句子的训练语料库,并在源句中明确标注习语的存在。
  • 通过fast-align进行词级对齐,以独立于上下文的方式隔离并评估习语翻译。
  • 提出两种新颖的评估指标:用于习语短语翻译的改进型unigram精确率,以及基于对齐词的词级习语准确率(WIAcc)。
  • 训练并比较神经机器翻译与短语基于机器翻译系统,包括一种在输入中加入特殊标记以指示习语存在的神经机器翻译变体。
  • 使用30,000次合并操作的Byte-Pair Encoding(BPE),并将标准BLEU作为整体翻译质量的基线指标。

实验结果

研究问题

  • RQ1当训练数据中习语较为稀少时,神经机器翻译在习语翻译上的表现与短语基于模型相比如何?
  • RQ2在输入中加入指示习语存在的特殊标记,是否能提升习语表达的翻译质量?
  • RQ3标准自动评估指标(如BLEU)在多大程度上能反映习语翻译的实际准确率?专用指标的表现如何?
  • RQ4神经机器翻译系统在习语翻译上的表现与在一般翻译任务上的表现相比如何?
  • RQ5数据规模与标注质量对神经翻译模型学习习语表达能力的影响如何?

主要发现

  • 尽管整体BLEU得分略有下降,但加入特殊习语标记的神经机器翻译系统在习语特异性unigram精确率和词级准确率上均优于基线神经机器翻译与短语基于模型。
  • 基线神经机器翻译系统在习语特异性测试集上的表现劣于在标准WMT测试集上的表现,表明当前神经机器翻译模型仍面临习语翻译的重大挑战。
  • 短语基于机器翻译系统在习语翻译上的性能差距较小,表明其在某些情况下能更可靠地记忆并复现习语短语,优于神经机器翻译模型。
  • 改进型unigram精确率指标有效捕捉到了习语翻译质量的提升,凸显其在针对性评估中的价值。
  • 词级习语准确率(WIAcc)指标表明,使用习语标记的神经机器翻译模型在习语短语中正确翻译的词的比例高于其他模型。
  • 新数据集的发布——包含103个独特的德语习语和132个独特的英语习语——为未来神经机器翻译中习语表达的研究奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。