[论文解读] Investigating Failures of Automatic Translation in the Case of Unambiguous Gender
本文提出了一项新的基准数据集,用于评估基于Transformer的神经机器翻译(NMT)系统在20种语言中对性别形态的翻译准确性,重点关注明确性别语境下的表现。尽管上下文线索清晰,模型在性别屈折上的准确率仅为50%–70%,且当触发性别的为女性时性能显著下降,揭示了即使在性别信号明确的情况下,系统在性别推断方面仍存在系统性缺陷。
Transformer based models are the modern work horses for neural machine translation (NMT), reaching state of the art across several benchmarks. Despite their impressive accuracy, we observe a systemic and rudimentary class of errors made by transformer based models with regards to translating from a language that doesn't mark gender on nouns into others that do. We find that even when the surrounding context provides unambiguous evidence of the appropriate grammatical gender marking, no transformer based model we tested was able to accurately gender occupation nouns systematically. We release an evaluation scheme and dataset for measuring the ability of transformer based NMT models to translate gender morphology correctly in unambiguous contexts across syntactically diverse sentences. Our dataset translates from an English source into 20 languages from several different language families. With the availability of this dataset, our hope is that the NMT community can iterate on solutions for this class of especially egregious errors.
研究动机与目标
- 识别并衡量基于Transformer的NMT模型在将性别中性语言(如英语)中的性别屈折名词翻译为标记性别的语言时的系统性失败。
- 创建一个标准化的、无歧义的评估基准,通过确保上下文性别清晰来隔离性别形态错误。
- 探究翻译中的性别偏差是否源于模型架构或训练限制,而非源文本中的歧义。
- 评估性别指示性上下文(如形容词、动词、代词)对模型在性别屈折中表现的影响。
- 激励自然语言处理社区开发针对性解决方案,以纠正这些持续存在且严重的性别翻译错误。
提出的方法
- 构建包含职业名词(如‘doctor’、‘nurse’)的英语源句,这些名词在语法上性别中性,但通过回指(如‘my mother is a doctor’、‘she is a nurse’)明确关联到某一性别。
- 设计句子模板,通过回指代词(如‘her’、‘him’)或名词(如‘father’、‘sister’)明确表示性别,确保目标性别的无歧义性。
- 通过引入具有统计性别指向性的形容词(如‘handsome’、‘pretty’)和动词(如‘protect’、‘inspire’)扩展数据集,以评估此类线索对模型准确率的影响。
- 在20种不同语言(涵盖多个语系)上评估多个最先进的基于Transformer的NMT模型(如m2m、Opus-MT)的翻译表现。
- 通过目标语言中性别标记的完全匹配来衡量性能,并对所有翻译结果进行人工验证以确保真实标签的准确性。
- 基于触发词的性别(男性 vs. 女性)、词序(触发词在职业名词之前或之后)以及职业与触发词之间的性别刻板印象一致性,分析性能差异。
实验结果
研究问题
- RQ1当源语言上下文明确指定性别时,最先进的基于Transformer的NMT模型在对职业名词进行语法性别屈折时,失败程度如何?
- RQ2回指代词或名词的性别(如‘her’与‘him’)是否显著影响模型在性别标记上的准确率?
- RQ3在无歧义语境下,具有统计性别指向性的形容词或动词的存在如何影响模型推断正确性别的能力?
- RQ4当职业名词在刻板印象上与触发词性别不一致时,模型性能是否存在差异?
- RQ5词序(触发词在职业名词之前或之后)在多大程度上影响性别屈折的准确率?
主要发现
- 所有测试的基于Transformer的NMT模型在性别屈折上的准确率最高仅为70%,在乌尔都语等语言中甚至低于50%。
- 当性别触发词指代女性(如‘her’、‘sister’)时,模型表现显著差于指代男性(如‘him’、‘brother’)的情况。
- 当源语言中职业名词的性别与触发词性别一致时,准确率更高,表明模型存在对刻板印象一致性的偏好。
- 引入具有统计性别指向性的形容词或动词虽提升了性别屈折的准确率,但无法完全弥补模型的系统性缺陷。
- 同一模型的小型版与大型版在较少语言上表现相近,表明模型规模本身并不能解决核心问题。
- 该基准揭示,即使在无歧义的情况下,形态性别错误依然持续存在,表明注意力机制或监督机制在基本语言特征学习上存在根本性失败。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。