Skip to main content
QUICK REVIEW

[论文解读] Evaluating Machine Translation Performance on Chinese Idioms with a Blacklist Method

Yutong Shao, Rico Sennrich|arXiv (Cornell University)|Nov 21, 2017
Natural Language Processing Techniques参考文献 12被引用 5
一句话总结

本文提出一种基于黑名单的自动评估方法,用于检测神经机器翻译(NMT)系统在中文习语翻译中的直译错误。该方法利用经筛选的词汇列表,识别可能的非习语化翻译,从而高精度地检测出此类错误。结果显示,在测试集中46.1%的习语被错误翻译,证实习语翻译仍是神经机器翻译中的重大挑战。

ABSTRACT

Idiom translation is a challenging problem in machine translation because the meaning of idioms is non-compositional, and a literal (word-by-word) translation is likely to be wrong. In this paper, we focus on evaluating the quality of idiom translation of MT systems. We introduce a new evaluation method based on an idiom-specific blacklist of literal translations, based on the insight that the occurrence of any blacklisted words in the translation output indicates a likely translation error. We introduce a dataset, CIBB (Chinese Idioms Blacklists Bank), and perform an evaluation of a state-of-the-art Chinese-English neural MT system. Our evaluation confirms that a sizable number of idioms in our test set are mistranslated (46.1%), that literal translation error is a common error type, and that our blacklist method is effective at identifying literal translation errors.

研究动机与目标

  • 解决当前缺乏针对中文习语翻译的专用自动评估方法的问题。
  • 识别并量化神经机器翻译系统中常见的直译错误(即习语被逐字翻译)问题。
  • 开发一种低成本、可扩展的评估方法,以补充人工评估和BLEU等全局指标。
  • 发布CIBB数据集,以支持中文到英文习语翻译的可复现评估。
  • 证明尽管神经机器翻译技术不断进步,直译错误仍是普遍存在的错误类型。

提出的方法

  • 构建一个黑名单,其中包含源自中文习语直译的词汇(例如,'三'、'四'对应'说三道四'),用以标识可能的直译错误。
  • 通过扫描机器翻译输出中是否包含黑名单中的任何词汇,将黑名单应用于机器翻译系统输出。
  • 使用CIBB数据集(包含50个非构式中文习语的1,194对中文-英文翻译对)来评估该方法。
  • 当黑名单成功标记出直译错误时,定义为“正确检测”,并基于人工标注的参考译文评估精确率与召回率。
  • 在最先进的神经机器翻译系统上开展案例研究,使用黑名单方法评估其性能。
  • 通过句法对齐和上下文分析减少误报,例如当黑名单词汇出现在非习语语境中时(如“风”出现在字面句中)。

实验结果

研究问题

  • RQ1当前的神经机器翻译系统在多大程度上会产生中文习语的直译?
  • RQ2基于黑名单的方法能否有效检测中文到英文机器翻译输出中的直译错误?
  • RQ3在习语翻译的评估中,该黑名单方法与人工评估及全局指标相比,在精确率和召回率方面表现如何?
  • RQ4测试集中有多少比例的习语翻译受到直译错误的影响?
  • RQ5该黑名单方法能否扩展到其他语言对,或与其他错误检测技术结合使用?

主要发现

  • 测试集中46.1%的习语翻译被错误翻译,表明中文到英文神经机器翻译中的习语翻译仍是重大挑战。
  • 直译错误是普遍存在的错误类型,黑名单方法以高精确率成功检测出此类错误。
  • 该方法正确识别出如将'说三道四'译为'The doctor said that you can’t say three things to me'的直译错误,其中'三'和'四'被列为黑名单词汇。
  • 当黑名单词汇出现在非习语语境中时(如字面句中的'wind'),会出现误报,凸显了上下文过滤的必要性。
  • 该方法无法检测非直译错误(如将'生龙活虎'错误地译为'have to'),证实其仅限于检测直译错误。
  • CIBB数据集(包含50个习语的1,194对翻译对)已公开发布,以支持可复现评估和未来研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。