Skip to main content
QUICK REVIEW

[论文解读] Multimodal Machine Translation with Embedding Prediction

Tosho Hirasawa, Hayahide Yamagishi|arXiv (Cornell University)|Apr 1, 2019
Natural Language Processing Techniques参考文献 16被引用 6
一句话总结

该论文提出了一种多模态神经机器翻译模型,通过将嵌入预测与预训练词嵌入相结合,以提升罕见词的翻译性能。通过预测词嵌入并从预训练词汇表中检索最近邻词,该模型在罕见词上实现了+7.67的F1分数提升,在BLEU上较基线模型提升+2.49,展现出在低资源和罕见词场景下的优越性能。

ABSTRACT

Multimodal machine translation is an attractive application of neural machine translation (NMT). It helps computers to deeply understand visual objects and their relations with natural languages. However, multimodal NMT systems suffer from a shortage of available training data, resulting in poor performance for translating rare words. In NMT, pretrained word embeddings have been shown to improve NMT of low-resource domains, and a search-based approach is proposed to address the rare word problem. In this study, we effectively combine these two approaches in the context of multimodal NMT and explore how we can take full advantage of pretrained word embeddings to better translate rare words. We report overall performance improvements of 1.24 METEOR and 2.49 BLEU and achieve an improvement of 7.67 F-score for rare word translation.

研究动机与目标

  • 为解决多模态NMT在罕见词上因训练数据有限而导致的性能不佳问题。
  • 探究如何在多模态翻译中有效利用预训练词嵌入。
  • 探讨嵌入预测是否能在标准NMT之外提升罕见词的翻译性能。
  • 评估使用预训练嵌入初始化不同网络组件(编码器与解码器)的影响。
  • 确定在嵌入预测背景下,视觉特征与图像预处理的最优使用方式。

提出的方法

  • 在IMAGINATION模型基础上扩展了一个嵌入预测头,用于预测目标词嵌入,而非使用词汇表上的Softmax输出。
  • 采用基于边距的排序损失函数,训练模型使预测嵌入接近真实词的嵌入,同时远离负样本。
  • 在预训练嵌入空间中执行最近邻搜索,以解码最终输出词。
  • 使用FastText嵌入初始化解码器嵌入层,且在训练过程中保持冻结,以保留语义结构。
  • 采用多任务学习与视觉潜在空间建模,联合优化图像与句子表示。
  • 应用图像去偏置预处理,以提升多任务设置下视觉特征的对齐效果。

实验结果

研究问题

  • RQ1使用预训练词嵌入进行嵌入预测能否提升多模态NMT性能,尤其是在罕见词上?
  • RQ2与编码器相比,使用预训练嵌入初始化解码器是否能获得更好的结果?
  • RQ3图像预处理(尤其是去偏置)如何影响多模态NMT中嵌入预测的性能?
  • RQ4在多模态翻译设置中,使用单语语料进行嵌入预训练会产生何种影响?
  • RQ5该模型在提升罕见词翻译准确率的同时,是否仍能保持翻译的流畅性?

主要发现

  • 所提模型在罕见词翻译上实现了7.67的F1分数提升,显著优于基线模型。
  • 该模型在整体翻译性能上提升2.49 BLEU和1.24 METEOR,展现出整体性能的显著增强。
  • 使用预训练FastText嵌入初始化解码器可带来+1.80 BLEU的提升,而初始化编码器仅带来+0.11 BLEU的提升,表明解码器具有显著的特定优势。
  • 微调嵌入层会降低性能,表明固定预训练嵌入有助于模型聚焦于罕见词。
  • 在多任务学习设置中,图像去偏置对有效利用视觉特征至关重要,原始图像会损害性能。
  • 该模型能将罕见词'voûte'正确翻译为'archway',而基线模型则倾向于选择更常见的同义词如'arch'或'monument'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。