[论文解读] Multi-Source Neural Machine Translation with Missing Data
本文提出了一种简单但有效的方法,用于在多语言语料不完整的情况下进行多源神经机器翻译(NMT),通过将缺失的源语言翻译替换为特殊标记 $<$NULL$>$。该方法可在标准多编码器和专家混合NMT架构中实现对不完整数据的训练与推理,相较于一对一NMT系统,在真实TED演讲数据上实现了最高达2.22个BLEU点的性能提升。
Multi-source translation is an approach to exploit multiple inputs (e.g. in two different languages) to increase translation accuracy. In this paper, we examine approaches for multi-source neural machine translation (NMT) using an incomplete multilingual corpus in which some translations are missing. In practice, many multilingual corpora are not complete due to the difficulty to provide translations in all of the relevant languages (for example, in TED talks, most English talks only have subtitles for a small portion of the languages that TED supports). Existing studies on multi-source translation did not explicitly handle such situations. This study focuses on the use of incomplete multilingual corpora in multi-encoder NMT and mixture of NMT experts and examines a very simple implementation where missing source translations are replaced by a special symbol . These methods allow us to use incomplete corpora both at training time and test time. In experiments with real incomplete multilingual corpora of TED Talks, the multi-source NMT with the tokens achieved higher translation accuracies measured by BLEU than those by any one-to-one NMT systems.
研究动机与目标
- 解决由于缺少翻译而导致多语言语料不完整时,训练和部署多源NMT系统的挑战。
- 实现在训练和推理阶段均有效利用所有可用源语言翻译,即使部分语言缺失。
- 评估将缺失输入简单替换为 $<$NULL$>$ 标记是否能提升翻译性能,相较于标准的一对一NMT系统。
- 在真实场景(如多语言字幕)中研究多源NMT的性能表现,其中完整覆盖极为罕见。
提出的方法
- 在训练和推理阶段,均使用学习得到的 $<$NULL$>$ 标记替换多源NMT中缺失的源句。
- 采用标准的多编码器NMT架构并结合全局注意力机制,其中解码器隐藏状态通过加权拼接编码器最终状态初始化。
- 在专家混合NMT模型中应用相同的 $<$NULL$>$ 标记策略,其中每个专家在双语子集上进行训练,输出由路由网络门控。
- 在来自TED演讲的真实不完整多语言语料上训练和评估模型,包括法语、葡萄牙语或其他语言缺失的情况。
- 使用BLEU分数作为主要指标,比较采用 $<$NULL$>$ 处理机制的多源NMT与一对一NMT系统的性能。
- 在完整(无缺失数据)和不完整(部分数据缺失)测试集上评估性能,以衡量模型的鲁棒性。
实验结果
研究问题
- RQ1在使用 $<$NULL$>$ 标记表示缺失输入的前提下,多源NMT系统是否能在不完整多语言语料上实现更高的翻译准确率?
- RQ2在真实世界不完整数据上,采用 $<$NULL$>$ 标记的多源NMT系统与一对一NMT系统相比,BLEU分数表现如何?
- RQ3当其他源语言(如巴西葡萄牙语)缺失时,即使仅存在一个额外源语言(如法语),是否仍能提升翻译质量?
- RQ4在缺失数据条件下,多编码器与专家混合两种多源NMT架构的表现有何差异?
主要发现
- 在 {En,Es,Fr}-to-Pt (br) 翻译任务中,采用 $<$NULL$>$ 标记的多源NMT模型相较于一对一NMT系统,BLEU分数提升了2.22分。
- 在 {En,Fr,Pt (br)}-to-Es 任务中,多编码器模型BLEU提升1.69分,专家混合模型提升1.19分。
- 在 {En,Es,Pt (br)}-to-Fr 任务中,专家混合模型相较一对一NMT系统实现了1.69分的BLEU提升。
- 即使仅有一个源句子可用(如仅英语),多源模型生成的翻译与参考译文完全一致,表明其对缺失数据具有强鲁棒性。
- 在示例(1)中,专家混合NMT模型的BLEU+1得分为0.726,显著优于一对一模型的0.266,尽管缺少巴西葡萄牙语输入。
- 所有性能提升均具有统计显著性(p < 0.01),证实 $<$NULL$>$ 方法在多种语言组合与模型架构下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。