Skip to main content
QUICK REVIEW

[论文解读] Automatic Testing and Improvement of Machine Translation

Zeyu Sun, Jie M. Zhang|arXiv (Cornell University)|Oct 7, 2019
Software Testing and Debugging Techniques参考文献 40被引用 4
一句话总结

该论文提出 TransRepair,一种完全自动化的框架,通过上下文相似的变异和变异测试检测并修复机器翻译系统中的翻译不一致问题。该方法在生成一致测试对方面达到 99% 的精确率,并修复了 Google Translate 和 Transformer 中 19–30% 的不一致错误。人工评估显示,87% 的修复结果提升了翻译一致性,27% 的修复结果提升了翻译可接受度。

ABSTRACT

This paper presents TransRepair, a fully automatic approach for testing and repairing the consistency of machine translation systems. TransRepair combines mutation with metamorphic testing to detect inconsistency bugs (without access to human oracles). It then adopts probability-reference or cross-reference to post-process the translations, in a grey-box or black-box manner, to repair the inconsistencies. Our evaluation on two state-of-the-art translators, Google Translate and Transformer, indicates that TransRepair has a high precision (99%) on generating input pairs with consistent translations. With these tests, using automatic consistency metrics and manual assessment, we find that Google Translate and Transformer have approximately 36% and 40% inconsistency bugs. Black-box repair fixes 28% and 19% bugs on average for Google Translate and Transformer. Grey-box repair fixes 30% bugs on average for Transformer. Manual inspection indicates that the translations repaired by our approach improve consistency in 87% of cases (degrading it in 2%), and that our repairs have better translation acceptability in 27% of the cases (worse in 8%).

研究动机与目标

  • 解决由于上下文敏感性误译而引发的机器翻译系统中的公平性和一致性错误,例如基于性别的差异。
  • 开发一种完全自动化、黑盒的机器翻译系统测试与修复技术,无需访问源代码或人工人工标注。
  • 通过检测上下文相似变异引发的翻译中断,并利用基于参考的修复方法后处理翻译,从而提升翻译一致性。
  • 评估黑盒与灰盒修复策略在修复最先进的翻译系统(如 Google Translate 和 Transformer)中不一致问题方面的有效性。
  • 证明自动化修复可在不重新训练模型的前提下,同时提升翻译的一致性和可接受度。

提出的方法

  • 通过将词语替换为语义和上下文相似的替代词(例如性别代词或同义词),在保持句子结构不变的前提下,应用上下文相似的变异生成测试输入。
  • 使用变异测试比较原始句子和变异句子的翻译结果,当翻译中未改变的部分显著不同时,标记为不一致。
  • 采用相似性度量(例如基于嵌入的度量)量化翻译子序列中的干扰程度,识别超过阈值的潜在不一致错误。
  • 通过后处理翻译结果(使用变异输入的参考翻译)实现黑盒修复,无需修改原始模型。
  • 通过利用模型内部行为(例如注意力机制或隐藏状态)指导后处理,实现灰盒修复(当可用时)。
  • 使用基于概率参考或交叉参考的技术,根据多个测试用例中的一致性,选择或优化翻译结果。

实验结果

研究问题

  • RQ1在无需人工标注的情况下,上下文相似的变异结合变异测试能否有效检测机器翻译系统中的不一致错误?
  • RQ2像 Google Translate 和 Transformer 这样的最先进翻译系统在多大程度上表现出上下文敏感的翻译不一致性?
  • RQ3黑盒与灰盒后处理技术能否自动修复检测到的不一致错误,同时保持或提升翻译质量?
  • RQ4与原始翻译相比,修复过程在提升翻译一致性和可接受度方面的有效性如何?
  • RQ5在机器翻译输出的自动化后处理中,修复精确率与翻译质量之间存在何种权衡?

主要发现

  • TransRepair 在生成能产生一致翻译的测试输入对方面达到 99% 的精确率,表明测试用例生成具有高度可靠性。
  • 评估结果显示,在上下文相似的变异下,Google Translate 和 Transformer 的不一致错误率分别约为 36% 和 40%。
  • 黑盒修复平均修复了 Google Translate 中 28% 的不一致问题,以及 Transformer 中 19% 的不一致问题,表明其在实际部署中的有效性。
  • 灰盒修复在 Transformer 上实现了平均 30% 的修复率,表明访问模型内部行为可显著提升修复效果。
  • 人工检查确认,87% 的修复翻译提升了一致性,仅有 2% 的情况导致质量下降,表明修复过程具有高度可靠性。
  • 在可接受度方面,27% 的修复翻译被评为优于原始翻译,仅有 8% 的情况更差,表明在流畅性和自然度方面整体有所提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。