[论文解读] Filling Gender & Number Gaps in Neural Machine Translation with Black-box Context Injection
该论文提出一种黑箱方法,通过在源句末尾附加上下文明确的提示(例如 'She said:)将性别和数信息注入预训练的神经机器翻译(NMT)系统。当正确注入性别和数信息时,该方法在英希翻译任务中将翻译准确率提升最高达2.3 BLEU,且无需修改模型或训练数据。
When translating from a language that does not morphologically mark information such as gender and number into a language that does, translation systems must "guess" this missing information, often leading to incorrect translations in the given context. We propose a black-box approach for injecting the missing information to a pre-trained neural machine translation system, allowing to control the morphological variations in the generated translations without changing the underlying model or training data. We evaluate our method on an English to Hebrew translation task, and show that it is effective in injecting the gender and number information and that supplying the correct information improves the translation accuracy in up to 2.3 BLEU on a female-speaker test set for a state-of-the-art online black-box system. Finally, we perform a fine-grained syntactic analysis of the generated translations that shows the effectiveness of our method.
研究动机与目标
- 解决从性别和数中性源语言翻译到形态丰富的目标语言时的形态歧义问题。
- 在不修改底层NMT模型或其训练数据的前提下,实现对生成翻译中性别和数标记的控制。
- 开发一种简单、可与后处理兼容的方法,利用句内回指链注入说话者和受话者属性。
- 在希伯来语、西班牙语、法语和俄语等多种语言对上评估该方法的有效性,这些语言中性别一致具有形态标记。
提出的方法
- 将预定义的文本提示(例如 'She said:)注入输入句,以明确表示说话者和受话者的性别与数。
- 利用句内回指链(例如 'I love you, she told him')建立明确的先行词关系,以指导形态决策。
- 作为推理前的预处理步骤应用该方法,并在生成后移除注入的提示,以保持输出的整洁。
- 依赖NMT模型固有的跟踪回指和形态一致性的能力,即使未显式训练此类信号也有效。
- 以黑箱方式运行——无需访问模型内部结构、参数或重新训练。
- 采用包装器方法,兼容任何预训练的NMT系统,包括Google Translate等商业API。
实验结果
研究问题
- RQ1黑箱方法能否有效将性别和数信息注入预训练NMT系统,以控制形态输出?
- RQ2注入上下文明确的提示是否能提升在性别和数歧义情况下的翻译准确率?
- RQ3该方法在具有不同形态标记系统的多种语言对之间具有多大程度的泛化能力?
- RQ4该方法对句法准确率有何影响,特别是在代词、动词和形容词的一致性方面?
- RQ5该方法能否应用于Google Translate等商业、非开源翻译系统?
主要发现
- 当正确注入性别和数信息时,该方法在英希测试集上将BLEU分数最高提升2.3分。
- 在使用Google Translate的女性说话者测试集上,该方法达到39.95的BLEU分数,优于基线和先前的最先进方法。
- 该方法在希伯来语、西班牙语、法语和俄语等多种语言中成功控制了第一人称和第二人称代词、动词和形容词的形态一致。
- 细致的句法分析证实,注入的上下文能有效引导模型生成正确的形态形式。
- 该方法在10种测试语言中的6种上具有泛化能力,其中60%的案例正确保留了性别标记,30%默认为阳性形式,10%默认为阴性形式。
- 即使应用于Google Translate等商业、封闭源代码的NMT系统,该方法依然有效,证明了其强大的黑箱兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。