Skip to main content
QUICK REVIEW

[论文解读] Incorporating Terminology Constraints in Automatic Post-Editing

David Wan, Chris Kedzie|arXiv (Cornell University)|Oct 19, 2020
Natural Language Processing Techniques参考文献 13被引用 4
一句话总结

本文提出使用自回归与非自回归Transformer模型进行术语约束型自动后编辑(APE),以在机器翻译输出中保持特定领域的词汇术语。实验表明,约束型APE在保持95%术语保留率的同时提升了翻译质量,并提出数据增强策略以增强对罕见或语义差异较大的约束的鲁棒性。

ABSTRACT

Users of machine translation (MT) may want to ensure the use of specific lexical terminologies. While there exist techniques for incorporating terminology constraints during inference for MT, current APE approaches cannot ensure that they will appear in the final translation. In this paper, we present both autoregressive and non-autoregressive models for lexically constrained APE, demonstrating that our approach enables preservation of 95% of the terminologies and also improves translation quality on English-German benchmarks. Even when applied to lexically constrained MT output, our approach is able to improve preservation of the terminologies. However, we show that our models do not learn to copy constraints systematically and suggest a simple data augmentation technique that leads to improved performance and robustness.

研究动机与目标

  • 填补自动后编辑(APE)系统在保留特定领域术语约束方面的空白。
  • 使APE模型能够在后编辑过程中系统性地保留用户指定的词汇术语,即使在应用于已受术语约束的机器翻译输出时亦如此。
  • 提升模型在处理罕见或语义差异较大的约束(如同义词和反义词)时的鲁棒性。
  • 探究自回归(Transformer)与非自回归(Levenshtein Transformer)架构在约束型APE中的有效性。
  • 开发并评估一种数据增强策略,以增强APE模型对约束的系统性复制能力。

提出的方法

  • 通过在输入序列中加入约束标记和因子(如源语言、约束、目标语言)来显式表示术语约束,作为编码器输入。
  • 训练自回归Transformer(MST)和非自回归Levenshtein Transformer(LevT)模型,生成包含指定术语对的后编辑结果。
  • 采用约束解码策略,即解码器以包含目标侧术语约束的初始部分输出序列进行初始化。
  • 通过使用Wiktionary将目标侧约束替换为同义词或反义词,实施数据增强,以在预训练和微调阶段增加对多样化约束类型的暴露。
  • 使用标准APE指标(BLEU、TER和术语保留率(Term%))评估模型性能。
  • 通过测量在将约束替换为语义差异较大的词(如同义词/反义词)时TER和BLEU的变化,评估模型稳定性。

实验结果

研究问题

  • RQ1约束型APE模型是否能在提升翻译质量的同时,保留95%的输入术语约束?
  • RQ2当应用于已受术语约束的机器翻译输出时,约束型APE与无约束APE在术语保留方面有何差异?
  • RQ3APE模型是否能系统性地复制任意术语约束(包括同义词和反义词)?
  • RQ4使用同义词和反义词约束进行数据增强在多大程度上提升了模型的鲁棒性和术语保留率?
  • RQ5当面对语义差异较大的目标侧约束(如同义词与反义词)时,约束型APE模型的稳定性如何?

主要发现

  • 约束型APE模型在自回归与非自回归模型中均能保留超过95%的术语约束,其中LevT模型达到最高覆盖率。
  • 在已受约束的机器翻译输出上应用无约束APE会导致术语保留率相对下降12.6%,证明了约束感知型APE的必要性。
  • 模型在系统性复制异常约束(如同义词和反义词)方面表现不佳,MST模型完全遗漏了反义词'Verkleinerung'。
  • 使用同义词和反义词进行数据增强可同时提升翻译质量(降低TER,提高BLEU)和术语保留率,尤其在微调阶段应用时效果更显著。
  • 同义词比反义词更难保留,可能是因为语言模型先验更倾向于保留原始术语而非语义相近的替代词。
  • Levenshtein Transformer模型在约束变化下表现出更高的TER分数,表明其稳定性低于自回归模型,提示速度与一致性之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。