Skip to main content
QUICK REVIEW

[论文解读] Multilingual Multi-modal Embeddings for Natural Language Processing

Iacer Calixto, Qun Liu|arXiv (Cornell University)|Feb 3, 2017
Topic Modeling参考文献 10被引用 15
一句话总结

本文提出了一种新颖的判别式模型,通过在多种语言的图像及其描述上进行联合训练,学习多语言多模态嵌入,采用改进的噪声对比估计损失来对齐图像与多语言句子表示。该模型在图像-句子排序、语义文本相似度以及神经机器翻译重排序任务中均实现了稳定提升,当用于重排序n-best翻译列表时,BLEU分数最高提升+4.5点,METEOR分数最高提升+2.6点。

ABSTRACT

We propose a novel discriminative model that learns embeddings from multilingual and multi-modal data, meaning that our model can take advantage of images and descriptions in multiple languages to improve embedding quality. To that end, we introduce a modification of a pairwise contrastive estimation optimisation function as our training objective. We evaluate our embeddings on an image-sentence ranking (ISR), a semantic textual similarity (STS), and a neural machine translation (NMT) task. We find that the additional multilingual signals lead to improvements on both the ISR and STS tasks, and the discriminative cost can also be used in re-ranking $n$-best lists produced by NMT models, yielding strong improvements.

研究动机与目标

  • 通过利用同一张图像的多种语言描述,改进多模态与多语言表征学习。
  • 解决单语模型在捕捉视觉内容多样化语言表达方面的局限性。
  • 开发一种统一的训练目标,联合优化图像-句子相似度与跨语言句子相似度。
  • 在下游任务(如图像-句子排序、语义文本相似度、神经机器翻译重排序)上评估该模型。
  • 证明即使在评估时仅使用一种语言,多语言信号也能提升单语模型的性能。

提出的方法

  • 为每种语言使用独立的门控循环单元(GRU)编码器,从词级表示生成句子嵌入。
  • 采用预训练的VGG-19卷积神经网络从FC7层提取图像特征,并将其投影到共享嵌入空间。
  • 应用一种改进的成对对比损失函数,同时整合图像-句子相似度与跨语言句子相似度,以提升对齐效果。
  • 将所有嵌入(图像与句子)归一化为单位范数,并通过余弦相似度计算相似度。
  • 采用基于噪声对比估计的目标函数,以区分跨语言的正样本(匹配)图像-句子对与负样本(不匹配)对。
  • 在神经机器翻译中采用重排序策略,将模型的相似度分数作为额外特征,以提升翻译质量。

实验结果

研究问题

  • RQ1与单语模型相比,联合训练多语言多模态数据是否能提升所学嵌入的质量?
  • RQ2在训练过程中引入跨语言句子相似度,对图像-句子检索与语义相似度任务的性能有何影响?
  • RQ3所提出的嵌入在用于重排序n-best翻译列表时,能在多大程度上提升神经机器翻译性能?
  • RQ4包含同一图像的多种语言描述是否能提升视觉语义的泛化能力?
  • RQ5在内语言与跨语言监督之间不同权衡(由β控制)对模型性能有何影响?

主要发现

  • 在英语图像-句子排序任务中,中位排名从8提升至5;在德语任务中,从11提升至6,表明检索性能显著提升。
  • 在SemEval 2014与2015的领域内STS任务中,模型分别取得0.821与0.864的皮尔逊相关系数,优于单语基线模型。
  • 当用于神经机器翻译的n-best列表重排序时,模型相比基线NMT模型实现+4.5 BLEU分数的提升。
  • 当使用β=0.25的MLMME模型进行重排序时,模型实现+2.6 METEOR分数提升与-6.1 TER分数降低,显著改善翻译质量。
  • 在NMT重排序任务中,β=0.25时取得最佳性能,表明对跨语言对齐的更强强调能提升翻译质量。
  • 即使在评估时仅使用英语编码器,训练时引入德语描述也能提升英语性能,尤其在β值较低时更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。