Skip to main content
QUICK REVIEW

[论文解读] Pronoun Translation in English-French Machine Translation: An Analysis of Error Types

Christian Hardmeier, Liane Guillou|arXiv (Cornell University)|Aug 30, 2018
Natural Language Processing Techniques参考文献 17被引用 6
一句话总结

本研究使用 PROTEST 测试套件,评估了规则基础、统计和神经机器翻译系统在英法翻译中代词翻译的表现。研究发现,尽管最近基于 Transformer 的神经机器翻译模型在句内回指和非回指代词方面表现有所提升,但所有系统在跨句依赖、性数一致以及功能区分方面仍存在困难,凸显了在建模代词功能和指代属性方面持续存在的挑战。

ABSTRACT

Pronouns are a long-standing challenge in machine translation. We present a study of the performance of a range of rule-based, statistical and neural MT systems on pronoun translation based on an extensive manual evaluation using the PROTEST test suite, which enables a fine-grained analysis of different pronoun types and sheds light on the difficulties of the task. We find that the rule-based approaches in our corpus perform poorly as a result of oversimplification, whereas SMT and early NMT systems exhibit significant shortcomings due to a lack of awareness of the functional and referential properties of pronouns. A recent Transformer-based NMT system with cross-sentence context shows very promising results on non-anaphoric pronouns and intra-sentential anaphora, but there is still considerable room for improvement in examples with cross-sentence dependencies.

研究动机与目标

  • 探究不同机器翻译架构在代词翻译中持续存在的挑战。
  • 评估规则基础、统计机器翻译和神经机器翻译系统在细粒度代词类型测试套件上的表现。
  • 识别与代词功能、性、数和指代属性相关的系统性错误模式。
  • 比较人工评估结果并评估代词翻译评估的可靠性。
  • 通过提升代词翻译中的功能和指代意识,提出改进机器翻译系统的建议。

提出的方法

  • 使用 PROTEST 测试套件对九个英法机器翻译系统进行人工评估,该套件根据功能(回指、事件指代、赘词代词、称呼指代)和语言特征对代词进行分类。
  • 包含规则基础系统、短语基础统计机器翻译系统和基于 Transformer 的神经机器翻译系统,包括具备上下文建模和规则基础后处理的系统。
  • 将系统输出与人工标注的基准标准进行对比,以识别错误类型及其频率分布。
  • 对人工判断进行元评估,以评估标注者间的一致性和评估的可靠性。
  • 分析错误原因,包括遗漏、性别/数一致错误,以及人称代词与指示代词之间的混淆。
  • 使用从 TED 演讲稿及其译文派生的平衡、人工标注的测试集,明确标注了先行词关联和功能特征。

实验结果

研究问题

  • RQ1规则基础、统计机器翻译和神经机器翻译系统在英法机器翻译中各类代词类型上的表现有何差异?
  • RQ2代词翻译中的主要错误类型是什么?它们如何随代词功能和句法位置而变化?
  • RQ3近期基于 Transformer 的神经机器翻译系统在代词翻译方面相较于早期统计机器翻译和规则基础方法有多大改进?
  • RQ4上下文建模机制在处理代词翻译中的跨句回指方面有多有效?
  • RQ5为何人工评估代词翻译时会出现显著分歧?这对评估方法论有何启示?

主要发现

  • 规则基础系统表现欠佳,主要由于过度简化,特别是在生成正确的指示代词(如 'ça' 或 'cela')方面。
  • 统计机器翻译和早期神经机器翻译系统存在显著不足,主要由于对代词功能和指代属性建模不足。
  • 基于 Transformer 的神经机器翻译系统在非回指代词和句内回指方面表现优异,但在跨句依赖方面仍表现欠佳。
  • 非主语代词的主要错误类型是目标语言中的遗漏,可能由于词对齐不可靠以及法语中与定冠词同音所致。
  • 人称代词与指示代词之间的混淆是主要错误来源,尤其在缺乏对目标语言代词形式全面覆盖的规则基础系统中更为明显。
  • 尽管采用了上下文建模,Yandex 神经机器翻译系统并未持续优于早期系统,表明仅靠上下文本身不足以解决复杂的回指问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。