[论文解读] Machine Translationese: Effects of Algorithmic Bias on Linguistic Complexity in Machine Translation
本文研究了机器翻译(MT)系统中算法偏见如何降低语言复杂性,提出了‘机器翻译语’(machine translationese)这一现象——即输出被简化、多样性降低。通过在PB-SMT、LSTM和Transformer模型中使用词汇和词形多样性度量,发现所有MT系统相较于训练数据显著降低了词汇和词形丰富度,其中Transformer表现最佳,但在法语和西班牙语等语言丰富度更高的语言中,词形多样性仍表现欠佳。
Recent studies in the field of Machine Translation (MT) and Natural Language Processing (NLP) have shown that existing models amplify biases observed in the training data. The amplification of biases in language technology has mainly been examined with respect to specific phenomena, such as gender bias. In this work, we go beyond the study of gender in MT and investigate how bias amplification might affect language in a broader sense. We hypothesize that the 'algorithmic bias', i.e. an exacerbation of frequently observed patterns in combination with a loss of less frequent ones, not only exacerbates societal biases present in current datasets but could also lead to an artificially impoverished language: 'machine translationese'. We assess the linguistic richness (on a lexical and morphological level) of translations created by different data-driven MT paradigms - phrase-based statistical (PB-SMT) and neural MT (NMT). Our experiments show that there is a loss of lexical and morphological richness in the translations produced by all investigated MT paradigms for two language pairs (EN<=>FR and EN<=>ES).
研究动机与目标
- 调查数据驱动的MT系统中的算法偏见是否导致语言丰富度的可测量损失,特别是词汇和词形多样性。
- 探讨这种减少的社会语言学影响,将其定义为‘机器翻译语’——一种人为贫乏的语言形式。
- 比较不同MT范式(PB-SMT、LSTM、Transformer)在多种语言对(EN↔FR、EN↔ES)中对语言多样性的影响。
- 开发并应用新颖的、适配的、自动化的评估度量方法,用于评估词汇复杂度、同义词频率和词形多样性。
- 评估观察到的多样性损失是否与BLEU和TER等翻译质量度量存在可测量的相关性。
提出的方法
- 将第二语言习得中的词汇频率分布(LFP)方法进行适配,用于评估MT输出中的词汇复杂度与多样性。
- 应用香农熵和辛普森多样性指数,测量词干具有两个或以上词形的词形多样性,排除仅有一个词形的词干以避免偏差。
- 提出一种新颖的自动评估方法,用于评估同义词频率,捕捉标准多样性度量无法涵盖的词汇丰富度。
- 在两种语言对(英语-法语和英语-西班牙语)上,评估三种MT架构——短语基于SMT(PB-SMT)、基于LSTM的序列到序列模型和Transformer(TRANS)。
- 在原始训练数据和MT生成的翻译中计算多样性得分(H表示香农熵,D表示辛普森多样性),并将其归一化至[0–100]以保证可比性。
- 使用标准MT评估度量(BLEU、TER)将语言多样性与翻译质量相关联,从而实现研究发现的交叉验证。
实验结果
研究问题
- RQ1与训练数据相比,数据驱动的MT系统在多大程度上降低了词汇和词形多样性?
- RQ2MT架构的选择(PB-SMT、LSTM、Transformer)在多大程度上影响了翻译中语言丰富度的保留?
- RQ3词形多样性损失是否损害了系统生成语法正确形式的能力,尤其是在词形丰富的语言中?
- RQ4语言多样性与BLEU和TER等标准MT质量度量之间是否存在可测量的相关性?
- RQ5‘机器翻译语’在多大程度上反映了算法偏见?其长期社会语言学影响是什么?
主要发现
- 所有MT系统——PB-SMT、LSTM和Transformer——在两种语言对中均显著降低了与原始训练数据相比的词汇和词形多样性。
- 词形多样性的香农熵(H)和辛普森多样性(D)得分在MT输出中持续偏低:法语中,H从75.20(原始)降至73.13(Transformer),D从56.42降至57.70;西班牙语中,H从78.42降至77.23,D从54.96降至56.26。
- Transformer模型在保留词形多样性方面优于PB-SMT和LSTM,尤其在法语和西班牙语翻译中表现更佳,但仍低于原始数据水平。
- 在翻译为英语时,PB-SMT在词形多样性方面优于LSTM,表明架构影响与目标语言类型学相关。
- 词形丰富语言(法语和西班牙语)中的多样性减少最为显著,原始数据与MT输出之间的差距大于英语。
- 语言多样性与更高的BLEU/TER得分之间存在强烈相关性,表明多样性度量可作为翻译质量的有意义代理指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。