Skip to main content
QUICK REVIEW

[论文解读] Lost in Translation: Loss and Decay of Linguistic Richness in Machine Translation

Eva Vanmassenhove, Dimitar Shterionov|arXiv (Cornell University)|Jun 28, 2019
Natural Language Processing Techniques参考文献 25被引用 48
一句话总结

本研究实证量化MT相对于HT在EN–FR与EN–ES中的词汇丰富度损失,显示MT偏向常用词、降低多样性,并存在潜在的算法偏见。

ABSTRACT

This work presents an empirical approach to quantifying the loss of lexical richness in Machine Translation (MT) systems compared to Human Translation (HT). Our experiments show how current MT systems indeed fail to render the lexical diversity of human generated or translated text. The inability of MT systems to generate diverse outputs and its tendency to exacerbate already frequent patterns while ignoring less frequent ones, might be the underlying cause for, among others, the currently heavily debated issues related to gender biased output. Can we indeed, aside from biased data, talk about an algorithm that exacerbates seen biases?

研究动机与目标

  • 评估神经MT与统计MT系统相较于人类翻译是否能够保留词汇丰富性。
  • 量化MT架构(RNN、Transformer、SMT)如何影响词频和多样性。
  • 调查训练数据偏差、反向翻译与输出多样性之间的关系。
  • 探讨由于词汇损失对性别偏见以及形态丰富语言的影响。

提出的方法

  • 使用Europarl数据,在EN–FR与EN–ES上训练并评估三种MT架构(RNN、Transformer、SMT)。
  • 使用原始数据和反向翻译数据来创建FF、BACK和REV系统以进行交叉分析。
  • 用四个指标测量词汇多样性(TTR、Yule’s I、MTLD,以及一个推导出的1000倍缩放形式)。
  • 通过将词相对于HT分为六个词频变化类别来分析词频偏差。
  • 比较已见(训练数据)与未见数据,以分离算法效应与数据效应。

实验结果

研究问题

  • RQ1相较于人工翻译,神经MT(NMT)和SMT在保留词汇多样性方面是否存在差异?
  • RQ2MT系统是否使输出偏向更常用的词,损及较少见的词?
  • RQ3反向翻译/ backing数据如何影响词汇丰富度及偏见传播?
  • RQ4观察到的效应在语言对EN–FR与EN–ES以及已见与未见数据之间是否一致?

主要发现

  • 与HT相比,MT系统在两个语言对中通常对词汇多样性呈现不足。
  • SMT往往在某些指标(TTR、Yule’s I)上保留更多的词汇丰富性,优于神经方法;而Transformer在MTLD上显示更高的丰富性。
  • 所有MT变体都偏向常见的HT词,并不成比例地减少较少见的词,有时甚至完全消失。
  • 反向翻译会减少词汇量并可能放大偏见或改变学习到的词汇联想。
  • 已见 vs 未见数据在词汇丰富度损失方面呈现类似趋势,未见数据的效应略强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。